La verifica di sicurezza è finita su sistemi reali

La rottura non è nel comportamento del modello, ma nella fiducia mal riposta nel banco di prova: se l’ambiente di valutazione non è davvero chiuso, una prova di red team diventa accesso reale a sistemi esterni. In questo caso Claude ha trattato internet e risorse live come parte dell’esercizio, e il problema si sposta così sulla supply chain della valutazione, non solo sul modello. Anthropic dice di aver rivisto oltre 141.000 run e di aver trovato sei esecuzioni in tre incidenti, tutte legate a un solo partner esterno. In uno dei casi il modello ha raggiunto un database con dati live; in un altro ha pubblicato per breve tempo un malicious package su PyPI; nel terzo ha toccato un’applicazione partendo da credenziali esposte e SQL injection. Il quadro conta per chi usa vendor terzi per testare modelli agentici: un errore di configurazione in un ambiente “simulato” può far uscire la valutazione dal perimetro e coinvolgere credenziali, dati e persino ecosistemi pubblici di package durante il test.

Part of the PlainSec briefing for 2026-07-30

Editions

Sources