AI · 120 giorni fa
Un modello può rifiutare il prompt e comunque trasmettere il pericolo a valle. La rottura non è nella risposta testuale in sé. È nella struttura nascosta, dove istruzioni malevole possono viaggiare all’interno di JSON dall’aspetto benigno e sopravvivere ai controlli basati solo sulla semantica.
1 fonte che coprono questa storia
Breaking the Black Box: A Case Study in Red-Teaming a Government Education AI
In a new red-teaming exercise, social engineering moved to advanced tunneling attacks, revealing a critical lesson in today's AI security.
Part of the PlainSec briefing for 2026-05-18