Notes de l'épisode
Un red-teamer IA réussit 84 % de ses attaques, les humains 13 %. Détecter l'injection est un combat perdu d'avance — seule une garde déterministe tient. Sophie et le Professeur Omni décortiquent pourquoi.
Dans cet épisode
- GPT-Red, l'attaquant IA entraîné en self-play, et sa trouvaille la plus vicieuse : la fausse chaîne de raisonnement
- Pourquoi la détection est probabiliste — et pourquoi l'arithmétique la condamne face à un attaquant surhumain
- La garde déterministe : séparer ce que le modèle propose de ce que le système autorise, et retirer la clé au lieu de surveiller la porte
Références
- Article complet : Détecter n'est pas bloquer
- Concepts : injection indirecte, fake chain of thought, lethal trifecta, garde à condition hors-modèle
Action 24h
Liste les actions irréversibles que ton agent peut déclencher seul. Chacune sans garde hors-modèle est une porte sans serrure.
Cet épisode utilise une voix de synthèse (IA). Le contenu est écrit et validé par l'équipe OmniRealm.
#sécurité IA#agents IA#prompt injection#red teaming#GPT-Red#garde déterministe