YecoAI

Yeco-PII v1.0

Modello proprietario da 278M. Batte l'OpenAI Privacy Filter 1.5B (F1 0.966 vs 0.769) su tutte le 6 lingue.

Abstract

Presentiamo Yeco-PII v1.0, un modello neurale da 278M di parametri per detection e anonimizzazione di PII che batte l'OpenAI Privacy Filter (1.5B) con 5,4× meno parametri: F1 0,966 vs 0,769, vincendo tutte le 6 lingue europee.

Benchmark

Valutato su righe reali mai viste in addestramento, con annotazioni di terze parti (Ai4Privacy). Stesso test per ogni modello. Divari di 20-38 punti F1 a nostro favore su ogni lingua.

  • 278M parametri · ~1,1 GB, formato HuggingFace standard
  • 24 tipi di entità protetti: nomi, codici fiscali, IVA, IBAN, carte, indirizzi, dati catastali
  • Certificato su IT, EN, FR, DE, ES, NL — italiano nativo
  • ~3.700 caratteri/secondo su CPU · ~1 GB RAM a regime

Perché la dimensione non è capacità

La detection non è un problema di forza bruta. Le reti di checksum (mod-97 per IBAN, Luhn per le carte) catturano solo ciò che una formula può validare. Nomi, indirizzi, organizzazioni e date non hanno checksum: serve vero apprendimento contestuale, ed è esattamente lì che i concorrenti più grandi perdono 20-30 punti F1.

Conclusioni

Modelli compatti valutati rigorosamente possono fare ingegneria meglio dei giganti sui compiti verticali. Yeco-PII è software proprietario; la documentazione tecnica completa è riservata ai clienti con licenza.

Contenuti correlati