Sicurezza AI · Attacco basato su AI

I filtri per request saltano quando i prompt si sommano

CrowdStrike ha mostrato che un content safety classifier pubblico può essere aggirato in modo riproducibile. Il controllo funziona bene sui singoli prompt, ma perde il quadro quando la richiesta dannosa viene spezzata in sottocompiti innocui e ricomposta fuori dalla sua vista.

Il risultato non è un errore di classificazione su una singola richiesta. È un limite strutturale: il filtro vede pezzi separati, li giudica correttamente benigni, e non vede che insieme producono il contenuto offensivo. CrowdStrike dice di aver validato il bypass su 9 categorie offensive su 10.

Per chi usa guardrail che decidono richiesta per richiesta, il punto è questo: l’assenza di un prompt chiaramente malevolo non basta a garantire la tenuta del controllo. Il rischio si sposta sui flussi che assumono che il classifier, da solo, blocchi l’abuso multi-step di un frontier model.

1 fonte · 1 giorno fa

Cronologia

Fonti

Part of the PlainSec briefing for 2026-10-07

Every edition of this story: I filtri per request saltano quando i prompt si sommano

Altro da oggi