Un classificatore di sicurezza può essere corretto su ogni singolo prompt e fallire sull'intera conversazione.