AI · 1 giorno fa
CrowdStrike ha mostrato che un content safety classifier pubblico può essere aggirato in modo riproducibile. Il controllo funziona bene sui singoli prompt, ma perde il quadro quando la richiesta dannosa viene spezzata in sottocompiti innocui e ricomposta fuori dalla sua vista.
Il risultato non è un errore di classificazione su una singola richiesta. È un limite strutturale: il filtro vede pezzi separati, li giudica correttamente benigni, e non vede che insieme producono il contenuto offensivo. CrowdStrike dice di aver validato il bypass su 9 categorie offensive su 10.
Per chi usa guardrail che decidono richiesta per richiesta, il punto è questo: l’assenza di un prompt chiaramente malevolo non basta a garantire la tenuta del controllo. Il rischio si sposta sui flussi che assumono che il classifier, da solo, blocchi l’abuso multi-step di un frontier model.
1 fonte che coprono questa storia
How Attackers Can Bypass LLM Safety Classifiers | CrowdStrike
The CrowdStrike Cyber Superintelligence Lab evaluated the most advanced publicly deployed content safety classifier and found it can be systematically circumvented.
Part of the PlainSec briefing for 2026-10-07