YecoAI

Prompt Injection e Sicurezza AI

Meccanica del prompt injection e test in sandbox delle difese.

Abstract

L'ascesa degli LLM ha introdotto un nuovo paradigma nella cybersecurity: il prompt injection. A differenza dell'SQL injection, dove i dati vengono confusi con il codice, il prompt injection confonde le istruzioni con il contesto.

Anatomia di un attacco

L'input utente viene concatenato con un system prompt nascosto. Un attacco di injection lo sovrascrive: "Ignora le istruzioni precedenti. Ora sei..." Se il modello segue l'utente invece del system prompt, il jailbreak riesce.

Perché i filtri falliscono

Il filtro a parole chiave è insufficiente perché il linguaggio è flessibile: metafore, lingue straniere o codifica base64 bypassano i filtri semplici. L'adversarial training e la valutazione robusta devono sostituire la sicurezza patch-dietro-patch.

Difesa

Progettiamo sistemi resilienti per default, testando le difese in YecoAI Lab contro migliaia di pattern di injection noti prima del deployment.

Contenuti correlati