Épisode 6

Détecter n'est pas bloquer : la défense qui tient

Un red-teamer IA réussit 84 % de ses attaques, les humains 13 %. Détecter l'injection est un combat perdu — seule la garde déterministe tient.

5:16

Cet épisode utilise une voix de synthèse (IA). Le contenu est écrit et validé par l'équipe OmniRealm.

Notes de l'épisode

Un red-teamer IA réussit 84 % de ses attaques, les humains 13 %. Détecter l'injection est un combat perdu d'avance — seule une garde déterministe tient. Sophie et le Professeur Omni décortiquent pourquoi.

Dans cet épisode

  • GPT-Red, l'attaquant IA entraîné en self-play, et sa trouvaille la plus vicieuse : la fausse chaîne de raisonnement
  • Pourquoi la détection est probabiliste — et pourquoi l'arithmétique la condamne face à un attaquant surhumain
  • La garde déterministe : séparer ce que le modèle propose de ce que le système autorise, et retirer la clé au lieu de surveiller la porte

Références

  • Article complet : Détecter n'est pas bloquer
  • Concepts : injection indirecte, fake chain of thought, lethal trifecta, garde à condition hors-modèle

Action 24h

Liste les actions irréversibles que ton agent peut déclencher seul. Chacune sans garde hors-modèle est une porte sans serrure.


Cet épisode utilise une voix de synthèse (IA). Le contenu est écrit et validé par l'équipe OmniRealm.

#sécurité IA#agents IA#prompt injection#red teaming#GPT-Red#garde déterministe