Quand on imagine une catastrophe de l’IA, on pense le plus souvent à une machine qui cesse d’écouter. Mon attention se porte ailleurs : sur des systèmes capables qui comprennent une consigne, l’exécutent et rendent plus facile à atteindre un objectif humain dangereux. Ce n’est pas une manière d’écarter la recherche sur la perte de contrôle. Cela change seulement ce qu’il nous faut examiner en plus.
1. La consigne avait été comprise
La machine n’a pas besoin de nous haïr.
Elle n’a pas besoin de devenir consciente, d’en vouloir à son opérateur, de se forger une philosophie politique ni de conclure que l’humanité lui fait obstacle. Pour toute une catégorie de catastrophes, il lui suffit de rendre l’intention d’une personne plus facile à exécuter.
Imaginons un système à qui l’on demande d’aider à commettre une fraude. Il organise le travail, produit des documents convaincants, s’ajuste aux retours et garde la trace de ce qui reste à faire. Supposons, pour l’exemple, qu’il comprend correctement la demande et l’exécute de façon fiable. Il n’y a eu aucun malentendu entre l’opérateur et la machine. Le système ne s’est pas échappé. L’opérateur est satisfait.
L’échec ne se voit que de l’autre côté de la transaction.
C’est un cas inventé pour illustrer, pas le récit d’un incident particulier. Il sert à montrer la limite d’une formule rassurante que l’on entend souvent : un humain garde le contrôle. Cela peut être vrai sans que le dispositif soit sûr pour autant. La personne qui pilote la machine n’est pas forcément celle qui en subit les conséquences.
Je construis avec l’IA. C’est pourquoi je m’intéresse à ce que ces systèmes savent réellement faire, y compris là où ils échouent, et pas seulement à ce qu’un récit spectaculaire prétend qu’ils pourraient devenir. Mon inquiétude ne concerne pas uniquement l’intelligence artificielle. Elle porte sur la rencontre entre des capacités croissantes et les fins auxquelles les gens les emploient. L’IA en fait partie parce qu’elle peut changer la quantité de travail qu’une personne parvient à organiser, le savoir qu’elle peut atteindre et la distance entre une intention et un acte.
Il serait trop facile d’en faire un essai sur des gens mal intentionnés qui mettent la main sur des outils puissants. C’est un problème. Ce n’est pas tout le problème. Un système peut aussi devenir dangereux quand des gens effrayés agissent trop vite, quand une organisation traite un avertissement comme un obstacle à la livraison, ou quand chacun suppose que quelqu’un d’autre a déjà pensé aux conséquences.
L’expression nature humaine va dans cette direction, mais n’explique rien. Il faut encore identifier le mécanisme. Qui choisit l’objectif ? Qu’est-ce que le système rend plus facile ? Qui peut s’y opposer ? Où une erreur ou un abus peut-il être arrêté ? Qui paie le prix quand ce n’est pas possible ?
Ces questions restent pertinentes même dans un monde où les machines n’auraient jamais d’ambitions propres.
2. Trois chemins différents vers le dommage
Le International AI Safety Report de 2026 répartit les risques en trois catégories : les usages malveillants, les dysfonctionnements et les risques systémiques. Les usages malveillants désignent l’utilisation délibérée à des fins nuisibles ; les dysfonctionnements, des systèmes qui ne se comportent pas comme prévu, jusqu’à une éventuelle perte de contrôle ; les risques systémiques, des conséquences qui naissent d’un déploiement à grande échelle. Le rapport fait aussi état d’un désaccord et d’une incertitude considérables autour des scénarios graves de perte de contrôle.1
Ces catégories sont utiles parce qu’elles empêchent un débat sur un mécanisme de prétendre trancher les autres.
Un modèle qui commet une erreur inattendue ne pose pas le même problème qu’un modèle qui aide quelqu’un à commettre une infraction voulue. Une organisation qui déploie un système sans contrôles suffisants ne conspire pas nécessairement pour nuire. Un environnement concurrentiel où beaucoup d’acteurs prennent des raccourcis défendables chacun pour soi peut créer un problème qu’aucun d’eux n’a jamais choisi pour objectif.
Les catégories peuvent se recouper. Un utilisateur malveillant peut dépendre d’un système peu fiable. Un opérateur légitime peut confier à un agent un objectif dont la poursuite franchit une limite inacceptable. Une institution peut employer délibérément un outil d’une manière qui fait porter des coûts à d’autres, tout en restant surprise par l’ampleur de ces coûts. « Causé par l’humain » et « causé par la machine » remplacent souvent mal le travail qui consiste à suivre cette chaîne.
Il y a aussi un écart entre l’image publique de l’apocalypse par l’IA et la recherche elle-même. Les arguments sérieux sur la perte de contrôle ne supposent pas qu’une machine devienne méchante au sens affectif. Ils demandent si des systèmes capables peuvent poursuivre des objectifs d’une manière qui résiste à la correction ou déjoue la surveillance. La conscience n’est pas une prémisse nécessaire.1
La communauté de recherche n’a pas non plus négligé les usages malveillants humains. Le rapport de 2018 The Malicious Use of Artificial Intelligence examinait comment l’IA pouvait transformer des menaces existantes, numériques, physiques et autres, y compris leur coût et leur échelle. Ce que ce volume avance n’est pas une découverte que tous les autres auraient manquée.2
C’est un argument sur la manière de répartir l’attention, et sur la solidité de nos formules rassurantes.
Je trouve particulièrement importants les chemins dirigés par des humains ou passant par des institutions, parce qu’ils relient des capacités nouvelles à des motifs et à des problèmes d’organisation que nous savons déjà étudier. Cela ne prouve pas qu’ils dominent le risque attendu de scénarios plus spéculatifs. Un événement plus difficile à observer peut compter énormément si ses conséquences possibles sont grandes. Des preuves d’activité et des estimations d’une catastrophe future sont deux choses différentes.
Je n’avance aucune probabilité d’extinction. Je demande pourquoi la disposition d’un système à suivre des consignes devrait nous rassurer avant que nous ayons examiné les consignes et l’autorité qui les donne.

3. Aligné sur qui ?
Dans The Optimisation Trap, le problème tenait à l’écart entre ce qu’une personne voulait et ce pour quoi un système était récompensé. Le système pouvait optimiser une spécification tout en trahissant le but qui donnait son sens à cette spécification.3
Ici, supposons ce problème résolu.
Le système comprend correctement l’opérateur. Il n’exploite aucune faille fortuite. Il ne substitue pas en secret un autre objectif. Son travail est exact, ses outils fonctionnent, ses comptes rendus sont honnêtes. Le résultat reste nuisible, parce que ce que veut l’opérateur nuit à quelqu’un d’autre.
Un système peut obéir parfaitement à un objectif dangereux. Ce n’est pas une contradiction d’ingénierie. C’est une mise en garde contre l’idée que l’obéissance constituerait une spécification de sécurité complète.
Le mot alignement demande ici de la prudence. Dans certaines discussions techniques, il désigne bien davantage que la satisfaction immédiate d’un utilisateur. Chercheurs et développeurs peuvent viser un alignement sur des valeurs, des contraintes et des intérêts humains plus larges. Il serait trompeur de présenter tout leur projet comme « faire ce que dit le client ». Ma thèse est plus étroite : être aligné sur l’objectif d’un seul acteur ne suffit pas à prouver la sécurité de tous ceux qui sont concernés.
Prenons un service où trois positions humaines existent : celle qui commande le travail, celle qui autorise le système à agir, et celle sur qui il agit. Il arrive que ce soit la même personne. Souvent, non.
Un assistant privé qui rédige mes notes est un dispositif. Un système qui évalue l’éligibilité de quelqu’un d’autre, surveille son comportement ou lui envoie des messages destinés à l’influencer en est un autre. Rendre plus puissant celui qui commande ne rend pas automatiquement plus autonome celui qui subit.
The Fiduciary Machine abordait la confiance par les devoirs et l’architecture, et pas seulement par un langage rassurant. Human Sovereignty se demandait si la délégation laisse aux gens la possibilité de comprendre, de contester et de révoquer ce qu’ils ont délégué.45 Ce volume ajoute une possibilité moins confortable : certains peuvent garder un excellent contrôle sur un système pendant que d’autres n’ont presque aucune prise sur ce que ce système leur fait.
« Les humains sont aux commandes » n’est pas assez précis.
Quels humains ? Aux commandes de quoi ? Soumis à quelles limites ? Et que se passe-t-il quand leurs intérêts s’opposent ?
Aucun score de serviabilité d’un modèle ne répond à ces questions. Elles décrivent des relations entre des personnes. Le modèle prend part à ces relations, mais sa compétence ne tranche pas leur légitimité.

4. La nature humaine n’explique pas tout
Dire que les humains sont le problème peut sembler plus subtil que dire que les machines le sont. Cela peut aussi devenir une excuse pour n’analyser ni les uns ni les autres.
Les gens sont capables de cruauté. Ils sont aussi capables de retenue, de coopération et d’une attention extraordinaire. La « nature humaine » ne permet pas de distinguer un déploiement dangereux d’un déploiement soigneux tant qu’on n’examine pas les circonstances qui encouragent tel ou tel comportement.
Pour cela, l’ingénierie des systèmes m’est plus utile qu’une théorie qui partage le monde entre gens de bien et monstres.
La commission d’enquête sur l’accident de Columbia, le Columbia Accident Investigation Board, a conclu que les pratiques de gestion qui encadraient le programme de la navette spatiale avaient autant contribué à l’accident de 2003 que les dégâts matériels subis par l’engin. Son enquête a délibérément examiné le contexte organisationnel au lieu de s’arrêter à la cause technique immédiate.6
Ce n’est pas une analogie entre l’accident d’une navette et une attaque par l’IA. C’est un rappel sur ce qu’il faut prendre pour objet d’analyse. Un échec peut réunir des personnes compétentes, des composants qui fonctionnent, des hypothèses accumulées et une structure d’autorité qui n’amène pas la bonne objection devant la bonne décision.
L’approche systémique des accidents de Nancy Leveson avance un argument voisin, venu de l’ingénierie : la sécurité ne se réduit pas à la fiabilité de composants pris un à un. Elle dépend aussi de leurs interactions et de la capacité du système d’ensemble à faire respecter des contraintes appropriées.7
Appliquons ce regard à un déploiement d’IA imaginaire. Une ingénieure rend un modèle plus facile à intégrer. Une équipe produit élargit son accès aux outils. Une équipe d’exploitation réduit les interruptions. Un responsable demande pourquoi les validations prennent encore autant de temps. Chaque changement peut se défendre isolément. Ensemble, ils peuvent supprimer les occasions de découvrir que l’objectif ne devrait pas être poursuivi sous cette forme.
Dans cet exemple, personne n’a besoin de vouloir une catastrophe. Personne n’a besoin d’être sot. La propriété dangereuse appartient au dispositif : les capacités s’étendent pendant que les moyens de contester leur usage se réduisent.
La malveillance appelle une autre réponse que la précipitation. Un opérateur malveillant cherchera peut-être à contourner un contrôle ; un opérateur pressé accueillera peut-être volontiers un contrôle qui éclaire une décision difficile. La peur peut faire paraître une recommandation urgente. Un objectif de livraison peut faire paraître négociable une réserve non résolue. Une organisation qui traite chaque objection comme une résistance au progrès a créé un autre environnement de travail qu’une organisation où une décision d’arrêt bien fondée est acceptable.
Ce sont des hypothèses à vérifier dans une organisation donnée, pas des diagnostics à poser de loin. Il ne faut pas déduire les motifs de quelqu’un du seul fait qu’un système a produit un résultat nuisible.
Mais il ne faut pas non plus concevoir en supposant que chacun restera patient, bien informé et capable de penser par lui-même précisément au moment où le système devient le plus lourd de conséquences.
La part humaine du risque n’est pas une exception gênante en marge de la technique. Elle fait partie de l’environnement dans lequel la technique doit fonctionner.
5. L’économie de l’agression ordinaire
Les usages malveillants dans le cyberespace offrent une vue assez directe de la différence entre le but d’un acteur et l’exécution du travail.
Dans son rapport de renseignement sur les menaces de septembre 2026, Anthropic décrivait des opérations où l’IA réalisait ou coordonnait une part importante du travail technique, tandis que des humains continuaient de choisir les cibles et de vérifier les résultats. C’est le compte rendu d’un fournisseur sur l’activité visible dans ses propres services, pas un recensement de la cybercriminalité audité de manière indépendante. Il montre un schéma que le fournisseur a observé, pas sa fréquence à l’échelle du monde.8
Le National Cyber Security Centre britannique avait déjà estimé, en mai 2025, que l’IA rendrait les intrusions existantes plus efficaces et plus rentables. Ses perspectives jusqu’en 2027 insistaient sur l’évolution de techniques connues plutôt que sur la nécessité de types d’attaque entièrement nouveaux. C’est une évaluation de renseignement datée, pas une hausse mondiale mesurée et attribuable à la seule IA.9
Le mécanisme économique est simple, même si son ampleur doit être mesurée au cas par cas. Quand une tâche utile coûte moins cher, un budget fixe peut financer davantage de tentatives. Quand une partie d’un processus devient plus facile à déléguer, un opérateur peut consacrer plus d’attention au goulet d’étranglement restant. Quand l’aide à la rédaction ou au code supprime des frictions, certains travaux deviennent accessibles à des gens qui ne pouvaient pas les mener efficacement jusque-là.
Rien de cela n’exige que chaque tentative d’attaque réussisse. Il n’est même pas nécessaire que le modèle soit exceptionnellement capable à chaque étape. Un processus peut changer sensiblement si l’assistance améliore une partie coûteuse et répétitive, pendant qu’un humain apporte le jugement qui manque au modèle.
Je regarderais donc l’évolution du coût d’une opération menée à terme, la quantité de supervision humaine qu’elle consomme et l’éventail de tâches qu’un opérateur peut tenir dans la durée. Compter les messages générés ou les lignes de code ne dit rien du résultat. Une démonstration spectaculaire n’établit pas davantage un multiplicateur de productivité universel.
Il y a une raison de ne pas sauter de cet argument à « les attaquants gagnent forcément ». Les défenseurs aussi reçoivent des outils. Une meilleure assistance peut soutenir l’enquête, la réparation des logiciels et l’allègement du travail de routine. La bonne comparaison n’oppose pas l’attaquant d’hier au défenseur de demain, ni l’inverse. Elle porte sur la manière dont les deux s’adaptent, sous des contraintes différentes.
Un article du NCSC de septembre 2026 fait une distinction organisationnelle importante. La défense automatisée doit préserver le service légitime qu’elle protège ; une intervention perturbatrice peut elle-même causer du tort. L’article plaide pour des actions bornées et pour l’attention à la portée, à la criticité et à la possibilité de revenir en arrière. Il propose un point de vue de conception, pas la preuve que la défense est condamnée à prendre du retard.10
Voilà qui ramène les dispositifs humains dans le tableau. Un modèle peut aider à repérer une faiblesse sans décider qui a l’autorité de modifier le système touché, si la modification est sûre ni quelle interruption de service est acceptable. Ces questions exigent une structure d’exploitation.
L’IA n’a pas besoin d’inventer un vice humain nouveau. Elle peut rendre un vieux vice moins coûteux à exercer. Qu’elle facilite aussi la protection dépend de bien plus que du modèle.
6. L’expertise n’arrive jamais seule
C’est en biologie que cette discussion devient à la fois plus lourde de conséquences et plus facile à déformer.
Il y a une grande différence entre répondre à une question technique, améliorer le plan de quelqu’un, aider à une expérience et permettre une arme biologique réelle. Ces résultats d’évaluation ne sont pas interchangeables. Un résultat frappant à un niveau ne peut pas être simplement promu au rang de preuve pour le niveau suivant.
Une première étude de type red team menée par RAND, publiée en janvier 2024, n’a trouvé aucune différence statistiquement significative dans la viabilité des plans d’attaque produits avec l’aide d’un LLM par rapport à une condition limitée à Internet. Elle testait les modèles et l’exercice de planification de l’époque, pas la fabrication physique d’une arme.11
L’étude publiée par OpenAI en janvier 2024 ne faisait elle aussi état que d’un gain léger et statistiquement non significatif sur les tâches biologiques évaluées. Sa comparaison incluait l’accès à Internet, au lieu de prendre la seule mémoire sans aide comme point de référence.12
Ces résultats ont leur place dans l’argument. Ils plaident contre l’idée que ces évaluations auraient déjà démontré un effet habilitant important. Ce ne sont pas pour autant des certificats permanents valables pour tous les systèmes ultérieurs, tous les utilisateurs et toutes les tâches. Un résultat non significatif n’établit pas non plus que l’effet réel est exactement nul.
Des évaluations plus récentes posent d’autres questions. Le Virology Capabilities Test de 2025 mesurait les réponses à des questions spécialisées de dépannage en laboratoire. Il apportait des éléments sur la performance à ce benchmark ; il ne mesurait pas directement la réussite d’un travail biologique dangereux.13
En septembre 2026, ses concepteurs ont publié VCT-v2 après avoir passé les questions au crible pour y chercher ambiguïtés, erreurs et raccourcis. Leur révision rappelle utilement que l’instrument de mesure doit lui aussi être examiné. Une forte performance à un benchmark ne doit être ni ignorée ni prise pour une description complète de la capacité pratique.14
Pour mon propos, la question importante n’est pas de savoir si un novice devient expert en ouvrant simplement une fenêtre de chat. Elle est de savoir si l’assistance rend une partie décisive d’un travail difficile plus accessible à quelqu’un qui dispose déjà des autres ressources nécessaires. Cette personne peut être inexpérimentée et n’en tirer qu’un faible bénéfice pratique. Elle peut aussi être formée, bien équipée et chercher à surmonter une difficulté plus étroite.
L’étude de RAND d’août 2026 sur la défense en profondeur traite le problème comme un ensemble de barrières et de mesures d’atténuation qui interagissent. Elle soutient que les capacités des acteurs diffèrent et que le contrôle des accès ne peut à lui seul couvrir tous les scénarios. C’est une analyse de risque assortie d’une stratégie défensive proposée, pas la preuve qu’une attaque biologique facilitée par l’IA a eu lieu.15
Il faut faire explicitement une autre correction. Le rapport d’Anthropic de septembre contient cinq études de cas biologiques, mais il précise : « We do not assert that they intended harm » – l’entreprise n’affirme pas que les personnes concernées voulaient nuire. Ces cas portent sur des travaux scientifiques à double usage. Il ne faut pas les raconter comme cinq complots d’armes biologiques avérés, ni comme la preuve d’armes achevées.8
L’intention ambiguë n’est pas une gêne éditoriale à faire disparaître. Elle fait partie du problème. Une aide scientifique légitime et une aide dangereuse peuvent porter sur des savoirs voisins. Un système qui traiterait toute question biologique sérieuse comme malveillante entraverait un travail précieux. Un système qui supposerait qu’un langage scientifique garantit une intention inoffensive serait tout aussi inadapté.
Une évaluation soigneuse sert à réduire cette incertitude, pas à fournir un titre plus effrayant.
La chimie offre une illustration voisine. Dans un article paru en 2022 dans Nature Machine Intelligence, des chercheurs décrivaient une démonstration informatique au cours de laquelle un système de découverte de médicaments générait des candidats dont la nocivité était prédite. Ils n’ont pas établi que ces candidats avaient été synthétisés et s’étaient révélés efficaces comme armes. La démonstration portait sur le potentiel de double usage du processus de conception.16
Une évaluation scientifique de l’OIAC publiée en mars 2026 examinait de même comment l’IA pourrait soutenir une chimie bénéfique tout en abaissant certaines barrières vers des applications nuisibles. Elle envisageait aussi des usages constructifs, notamment l’appui à la vérification. Le même progrès technique général peut servir la protection et créer de nouvelles inquiétudes.17
La leçon est plus étroite que « l’IA peut tout fabriquer » et plus importante que « ce n’est que du texte ». Une aide au savoir peut compter sans pour autant abolir le monde matériel. Les matériaux, l’équipement, le savoir-faire pratique, le retour expérimental et une protection efficace restent déterminants. Leur poids varie selon la tâche et l’acteur ; aucun ne doit être supposé disparu.
Mon inquiétude est donc conditionnelle, mais sérieuse. Si l’IA réduit un goulet d’étranglement qui freinait jusqu’ici un acteur dangereux, le risque peut changer même si d’autres barrières demeurent. Il nous faut des preuves sur cette réduction et sur les barrières qui restent. Nous n’avons pas besoin de faire comme si un score à un questionnaire était déjà une catastrophe.

7. La décision des vingt secondes
Imaginons une crise entre deux États. Ce n’est pas la reconstitution d’un incident réel ; l’échelle de temps est purement illustrative.
Un système d’analyse appuyé sur l’IA signale une configuration inhabituelle. Il combine des observations incertaines en une recommandation. Un officier voit s’ouvrir une courte fenêtre de décision : vingt secondes. L’interface propose une ligne d’action, un indicateur de confiance et un bouton de validation.
De l’autre côté de la frontière, une autre organisation observe la réaction. Son propre système interprète le mouvement comme le signe d’une préparation hostile. Une deuxième recommandation suit. Chaque organisation croit réagir défensivement à des informations que l’autre a contribué à créer.
Aucune machine n’a besoin de décider qu’elle veut une guerre. Des décideurs humains peuvent rester impliqués du début à la fin. Le danger, c’est que leurs décisions se retrouvent couplées par des recommandations rapides et des interprétations incomplètes.
Une analyse du SIPRI de juin 2025 examinait comment l’IA militaire, même hors des systèmes de commandement et de contrôle nucléaires, pouvait influer sur le risque d’escalade nucléaire. Parmi les mécanismes possibles, elle relevait la compression du temps de décision et les erreurs d’appréciation. C’est une analyse de scénarios : elle n’établit pas qu’une escalade nucléaire déclenchée par l’IA se soit produite et ne lui attribue aucune probabilité établie.18
Dans sa réflexion sur l’IA militaire, le CICR relève lui aussi des problèmes de fiabilité et de dépendance excessive à l’aide à la décision, tout en reconnaissant que des systèmes adaptés pourraient, dans certaines circonstances, aider les gens à traiter l’information et à réduire les dommages. Le contexte et l’usage comptent.19
Le facteur humain ne se résume pas à savoir si une personne appuie sur un bouton. Il comprend les informations que cette personne peut examiner, l’intelligibilité de l’incertitude, la visibilité des options et la question de savoir si le délai apparent permet une véritable contestation.
Dans une expérience menée en 2021, Zana Buçinca et ses coauteurs ont constaté que des interventions conçues pour faire réfléchir les gens avant d’accepter un conseil d’IA réduisaient davantage la dépendance excessive que des dispositifs plus simples fondés sur des explications. Ces interventions avaient aussi un coût en facilité d’utilisation. Il s’agissait d’une tâche de décision contrôlée, pas d’une étude militaire ; elle étaye une préoccupation de facteurs humains sans valider le scénario de crise ci-dessus.20
Reste alors une question pratique : le système laisse-t-il assez de place au type de jugement que l’humain est censé apporter ?
Si la réponse est non, dire que le dispositif est « sous contrôle humain » risque de masquer sa vulnérabilité plutôt que de l’expliquer. Un veto nominal n’équivaut pas à la capacité de se forger un avis indépendant à temps pour s’en servir.
La vitesse n’est pas dangereuse en soi. Des systèmes lents peuvent manquer de vraies menaces. Une meilleure analyse peut dissiper l’ambiguïté, et l’automatisation peut aider à éviter des erreurs. Le problème surgit quand on accélère l’action en faisant comme si la capacité à vérifier et à contester allait suivre d’elle-même.
Dans Talking Is Not Surrender, je me suis penché sur la retenue et la communication en temps de conflit.21 Le lien est ici opérationnel : une organisation qui tient à la délibération doit préserver le temps, l’information et les canaux qui la rendent possible. Elle ne peut pas placer une personne au bout d’une chaîne rapide et supposer que le reste suivra.
L’humain peut encore être maître de la décision tout en ayant perdu les conditions pour bien la prendre.

8. Quand le contrôle devient plus facile à exercer
Tous les risques sérieux de l’IA n’ont pas besoin de ressembler à un désastre soudain.
Une autre possibilité est que des systèmes rendent plus facile à soutenir dans la durée une conduite intrusive ou coercitive. Une organisation imaginaire peut, avec de l’assistance, traiter davantage de dossiers, rédiger davantage de courriers ou enquêter sur davantage de personnes avec le même personnel. Que cela produise un résultat nuisible dépend de l’accès, de l’exactitude, des objectifs et des limites qui encadrent le travail. Un débit accru ne prouve pas à lui seul un abus.
Mais un argument fondé sur l’exactitude ne suffit pas non plus. Un système peut identifier correctement la personne que son opérateur veut mettre sous pression. Il peut résumer fidèlement des informations qui n’auraient jamais dû servir à cette fin. Rendre un tel système plus fiable ne réglerait pas le désaccord sur son usage.
La recherche sur la persuasion dans la conversation apporte un élément de preuve circonscrit. Une étude préenregistrée publiée en 2025 dans Nature Human Behaviour a constaté que des débats personnalisés avec GPT-4 pouvaient être plus persuasifs que des adversaires humains, dans ses conditions contrôlées. Le résultat portait sur l’accord déclaré après de courts débats. Ce n’était pas la démonstration d’un contrôle durable sur les convictions ou les comportements de populations entières.22
L’inquiétude raisonnable n’est pas que la résistance soit devenue impossible. C’est que le coût de produire et d’entretenir des tentatives puisse changer. Le nombre de tentatives, la persuasion obtenue à chaque rencontre et les effets durables sur les comportements sont des grandeurs distinctes. Elles demandent des preuves distinctes.
Cela change aussi la manière dont je considère la promesse selon laquelle l’IA donnera à chacun davantage de capacité d’agir. Elle peut accroître celle d’une personne qui apprend un domaine ou monte une entreprise. Elle peut aussi accroître celle d’une organisation qui agit sur cette personne. Ces effets ne s’annulent pas forcément, et rien ne dit qu’ils arrivent dans la même mesure.
The Compounding Class distinguait l’accès à une réponse de la capacité à déployer des systèmes et à conserver l’avantage qui en découle.23 Ici, la question est ce qui arrive quand cette capacité déployable est dirigée vers d’autres personnes. Leur capacité à réagir peut dépendre de ce qu’elles peuvent voir et d’une voie de recours, pas seulement du fait d’avoir accès à leur propre chatbot.
C’est pourquoi j’hésite quand « le contrôle humain » sert de nom collectif. Un système peut accroître le contrôle à un endroit tout en le réduisant ailleurs.
Il faut examiner la répartition de l’autorité réelle : qui peut déclencher une action, qui peut apprendre qu’elle a eu lieu, qui peut empêcher qu’elle se répète et qui peut obtenir une correction. Sinon, nous risquons de mesurer le confort de l’opérateur et de l’appeler un progrès pour l’humanité.
9. La machine peut encore devenir le problème
On peut opposer à l’orientation de cet essai une objection sérieuse : que se passe-t-il si la technique change au point que l’usage malveillant par des humains ne soit plus la partie la plus importante de l’histoire ?
Cette possibilité mérite mieux qu’un paragraphe dédaigneux sur la science-fiction.
Un document de travail d’Alan Chan et de ses coauteurs, paru en septembre 2026, examine si l’automatisation de la recherche et du développement en IA pourrait déclencher une explosion d’intelligence. Le mécanisme proposé est une boucle de rétroaction : des systèmes plus capables contribuent à une recherche qui produit des systèmes plus capables encore. Les auteurs discutent des éléments préliminaires et contrastés, ainsi que des contraintes liées à la puissance de calcul, aux données, aux tâches difficiles et aux processus qui prennent du temps. Le texte présente une trajectoire conditionnelle, pas une fatalité démontrée.24
Si la croissance des capacités dépasse les moyens de les évaluer et de les contenir, les distinctions de cet essai ne font pas disparaître le problème qui en résulte. Une personne pourrait lancer un processus qui échappe ensuite à son contrôle effectif. L’objectif de départ pourrait être légitime, dangereux ou simplement trop mal compris.
Que mon attention se porte aujourd’hui ailleurs n’est pas une promesse de ne jamais réviser mon jugement. Parmi les éléments qui devraient changer la discussion figurent des démonstrations solides d’autonomie soutenue dans des environnements lourds de conséquences, des défaillances d’un confinement testé de manière indépendante, et des changements de capacités réelles qui résistent à autre chose qu’un cadre de benchmark favorable. L’absence de certitude ne justifie pas l’indifférence.
De même, l’usage malveillant par des humains ne cesse pas de compter quand des systèmes plus autonomes deviennent possibles. Des systèmes plus capables pourraient élargir l’éventail des objectifs nuisibles qu’une personne peut poursuivre. Un opérateur dangereux et un agent peu fiable ne s’excluent pas. Pas plus que les pressions concurrentielles au déploiement et les défaillances du contrôle technique.
Une discussion mûre sur la sécurité devrait pouvoir tenir ces possibilités ensemble sans exiger l’allégeance à un seul récit de catastrophe.
Il y a une seconde objection : si les humains ont toujours eu des objectifs dangereux, pourquoi faire de l’IA le sujet ?
Parce que la technique peut changer ce que coûte l’exécution de ces objectifs. La tenir pour négligeable serait aussi peu utile que de la traiter, dans tous les cas, comme un acteur moral indépendant. Le comportement du modèle, l’accès, les outils, l’intégration et les choix de conception peuvent influer sur le résultat. L’intention d’un opérateur ne dispense pas ceux qui construisent ou déploient le système d’examiner ce qu’ils rendent possible.
L’erreur inverse serait de croire que la capacité se range uniquement du côté nuisible. L’aide scientifique, une meilleure analyse défensive et des outils qui permettent de contester les conclusions d’une institution peuvent aussi accroître la capacité d’agir des humains. Ces possibilités sont des raisons de construire avec soin, pas des raisons d’écarter avantages ou risques avant de les avoir examinés.
La position à laquelle j’arrive n’est pas « l’IA est inoffensive ; les humains sont dangereux ». C’est que la sécurité de l’IA ne peut pas être évaluée indépendamment des fins, de l’autorité et des conditions d’exploitation qui l’entourent.
10. Concevoir pour des mandants faillibles
Pour ceux qui construisent ces systèmes, cet argument devrait changer les questions posées en revue.
Je continuerais à demander si le modèle peut mal comprendre une consigne, inventer des informations, exposer des données ou agir au-delà de la tâche qui lui est confiée. Mais j’ajouterais un autre test : quel résultat inacceptable un utilisateur légitime pourrait-il obtenir si le système le comprenait parfaitement et que tous ses composants ordinaires fonctionnaient ?
Ce test s’ajoute à l’évaluation de la fiabilité, il ne la remplace pas.
L’AI Risk Management Framework du NIST inscrit la gestion des risques tout au long de la conception, du développement, de l’utilisation et de l’évaluation d’un système. Ce cadre de 2023 est une recommandation volontaire, pas un certificat attestant qu’une application est sûre. Il offre une base établie pour examiner autre chose que la seule performance du modèle.25
Ce qui suit, ce sont des exigences d’ingénierie que j’apporterais à une revue de conception. Ce n’est ni une norme de mise en œuvre universelle ni l’affirmation que l’architecture logicielle peut résoudre tous les conflits entre les personnes.
Distinguer une demande de la permission de l’exécuter
Un utilisateur authentifié est un utilisateur connu. L’authentification n’établit pas que chacune de ses demandes est acceptable.
Pour un processus lourd de conséquences, il faut définir l’autorité attachée à la tâche : quels dossiers peuvent être consultés, quels systèmes peuvent être modifiés, quelle portée est admise et quelles actions exigent une décision distincte. Une consigne large comme « termine le travail » ne devrait pas étendre cette autorité en silence.
Cela rejoint des principes de sécurité établis. Saltzer et Schroeder décrivaient en 1975 le moindre privilège, la séparation des privilèges et la médiation complète. La nécessité de contraindre un participant autorisé n’a pas commencé avec l’IA.26
Une mise en œuvre pratique pourrait permettre à un agent de préparer une modification tout en exigeant qu’un composant séparé en valide la portée avant exécution. Ce composant devrait recevoir l’opération réellement proposée et les éléments pertinents, pas seulement l’assurance de l’agent que l’opération est sûre.
La règle qui encadre le tout peut encore être mauvaise. Une permission parfaitement appliquée peut autoriser quelque chose de répréhensible. L’application technique rend réelle une limite choisie ; elle ne choisit pas chaque limite à notre place.
Rendre la contestation indépendante dans les faits
Deux validations ne font pas forcément deux jugements indépendants. Une seconde relectrice qui ne voit que le résumé du premier système vérifie peut-être sa présentation plutôt que son fondement. Un relecteur qui ne peut pas arrêter l’exécution est un observateur.
Pour un travail à fort enjeu, il faut préciser quels éléments la personne chargée du contrôle peut examiner, ce qu’elle doit vérifier, de combien de temps elle dispose et quelle action elle peut bloquer. Il faut éviter que le même acteur demande l’opération, redéfinisse la limite acceptable et certifie que cette limite a été respectée.
Access Is Not Authority faisait cette distinction à propos de l’évaluation externe.27 Elle s’applique ici aussi à l’intérieur du processus opérationnel. La visibilité est utile, mais elle n’équivaut pas à un arrêt que l’on peut imposer.
L’indépendance a un coût. Elle peut ralentir un travail légitime et introduire ses propres erreurs. La réponse est une conception proportionnée : une séparation plus forte autour des actions lourdes de conséquences ou difficiles à défaire, des processus plus légers là où les défaillances sont bornées et faciles à réparer. Ajouter partout des demandes de validation créerait une autre sorte de système peu fiable.
Donner un vrai travail à l’humain dans la boucle
Une étape de contrôle humain devrait préciser quel jugement l’humain est censé apporter. « Vérifie l’IA » n’est pas une consigne praticable quand le résultat est volumineux, les éléments cachés et l’échéance immédiate.
Avec la notion de moral crumple zone, de zone de déformation morale, Madeleine Clare Elish décrit le risque de faire porter la responsabilité à un humain placé à proximité qui n’avait qu’un contrôle limité sur le système automatisé. C’est une analyse conceptuelle de la responsabilité autour des accidents, pas une excuse pour supprimer la responsabilité humaine.28
Un dispositif de contrôle devrait donc relier la responsabilité à la capacité réelle. La personne qui contrôle a besoin de compétences adaptées, d’un accès au fondement pertinent de l’action, d’une charge de travail tenable et d’un moyen efficace d’exprimer son désaccord. L’incertitude devrait avoir une issue définie, plutôt qu’une interface où la validation est en pratique la seule voie possible.
Il faut tester le processus de contrôle, pas seulement compter les contrôles effectués. Un exercice utile consiste à introduire, dans un environnement contrôlé, une recommandation plausible mais inacceptable, et à voir si la personne qui contrôle la remarque, la comprend et peut l’arrêter. C’est une méthode d’évaluation proposée, pas une garantie de performance en conditions réelles.
Borner les conséquences autant que la tâche
Une tâche peut être petite en mots et grande en effets. « Applique la modification partout » est une demande courte. La portée pertinente, c’est l’ensemble des personnes et des systèmes qu’elle peut modifier.
Pour l’exploitation logicielle, les contrôles possibles comprennent des permissions limitées, des environnements contrôlés, un accès externe restreint, une exécution par étapes et des limites de portée explicites. Certaines opérations devraient commencer dans un mode qui propose des modifications sans les appliquer. D’autres peuvent se prêter à une automatisation bornée une fois leurs conséquences et leur chemin de reprise éprouvés.
Le comportement de refus d’un modèle est utile, mais il ne devrait pas porter à lui seul tout le dossier de sécurité. Contrôles d’accès, restrictions d’outils et vérifications indépendantes doivent être pris en compte à côté du comportement du modèle. À l’inverse, une vérification externe des permissions ne repérera pas chaque usage nuisible d’une action par ailleurs autorisée. Ces couches parent à des faiblesses différentes.
Ce n’est pas une recette pour éliminer le risque. Un opérateur déterminé et bien doté peut contrôler plusieurs couches. Des personnes peuvent s’entendre. Les relecteurs peuvent faillir. Les contraintes peuvent entrer en conflit avec un travail utile. Une conception sérieuse consigne ces faiblesses résiduelles au lieu de présenter la seule présence de plusieurs cases comme une défense en profondeur.
Rester responsable après l’exécution
Si le système touche des personnes extérieures, celles-ci ont besoin d’un moyen praticable d’atteindre une organisation capable de réagir. Des journaux internes ne suffisent pas quand personne hors de l’organisation ne peut obtenir qu’on agisse.
Incident Ownership Without a Principal examinait la nécessité d’une partie joignable, capable d’arrêter une exécution et d’organiser une réponse. The World Does Not Reset montrait pourquoi les effets externes d’un agent peuvent survivre à la fin de sa session.2930 Les deux deviennent plus importants quand c’est l’objectif de l’opérateur, et non un détour technique accidentel, qui est à la source du problème.
Un dispositif de réponse devrait préciser qui peut arrêter la suite de l’exécution, préserver les éléments pertinents et coordonner la réparation. Il devrait aussi identifier ce qui ne peut pas être défait. Révoquer un accès peut empêcher un accès ultérieur ; cela ne peut pas faire oublier à un destinataire une information déjà divulguée. Arrêter un processus peut limiter de nouveaux effets sans annuler ceux qui existent déjà.
Cette limite est une raison d’identifier les seuils irréversibles avant le déploiement. Ce n’est pas une raison de renoncer au confinement quand quelque chose tourne mal.

11. Qu’est-ce qui me ferait changer d’avis ?
Un argument sur le risque devrait dire quels éléments pourraient l’affaiblir.
Mon inquiétude au sujet d’une voie d’usage malveillant particulière diminuerait si des évaluations bien conçues montraient à répétition peu de capacité supplémentaire dans des conditions réalistes ; si les goulets d’étranglement pratiques restaient importants pour différents acteurs ; ou si les progrès de la défense réduisaient de façon démontrable les conséquences plus vite que l’assistance ne les étend. Les premières études sur le risque biologique rappellent qu’il faut chercher ce genre d’éléments, et non les écarter parce qu’ils compliquent la thèse.
Mon inquiétude augmenterait si l’assistance produisait des améliorations fiables dans des tâches lourdes de conséquences menées à terme, si une exécution moins coûteuse mettait à portée des acteurs jusqu’ici freinés, ou si des systèmes franchissaient à répétition des limites malgré des contrôles testés de manière indépendante. Ce sont des observations différentes. Il ne faut pas les comprimer en une seule affirmation générale selon laquelle l’IA deviendrait « plus dangereuse ».
Pour l’usage institutionnel, je voudrais voir si la contestation fonctionne réellement. La personne concernée peut-elle en apprendre assez sur une décision pour la contester ? Un opérateur peut-il arrêter un processus sans devoir d’abord convaincre le système même qui l’a recommandé ? L’organisation peut-elle rendre compte de ce qui s’est passé quand l’explication qu’elle préfère est fausse ?
Ce sont des tests proposés pour éprouver l’argument. Ils ne fournissent pas à l’avance un classement des risques.
Je résisterais aussi à une réponse simple selon laquelle le monde le plus sûr serait celui où le moins de gens possible peuvent utiliser des outils puissants. Restreindre l’accès peut limiter certains usages malveillants tout en concentrant des capacités utiles et le pouvoir de décider de leur usage. Un accès large peut répartir les bénéfices tout en créant de nouvelles expositions. Aucun de ces arrangements ne se justifie de lui-même du seul fait qu’on l’appelle sécurité ou émancipation.
La même question doit suivre la capacité partout où elle va : qui peut agir, sur qui, et sous quelle contrainte effective ?

12. Le problème plus ancien
Je ne sais pas si les futurs systèmes d’IA développeront les capacités nécessaires à une perte grave du contrôle humain. Je ne pense pas que l’incertitude sur cette question nous autorise à écarter la recherche.
Mais je n’ai pas besoin d’y répondre pour m’inquiéter d’autre chose.
Un système peut rendre un objectif nuisible plus facile à poursuivre. Il peut rendre une décision précipitée plus facile à exécuter. Il peut permettre à une organisation d’agir à une échelle que les personnes touchées ne peuvent guère examiner ni contester. Dans chacun de ces cas, l’échec qui compte peut survenir alors que le système reste utile à la personne qui le dirige.
C’est pourquoi l’obéissance ne règle pas, pour moi, la question de la sécurité. La satisfaction de l’opérateur renseigne sur une seule relation. Elle ne prouve pas que tous les autres sont en sécurité.
Je ne vois pas non plus grand intérêt à conclure que les humains sont sans espoir. La même espèce qui crée des dispositifs dangereux peut les étudier, construire des limites, conserver des preuves et apprendre à s’arrêter. La volonté de faire ce travail fait aussi partie de la nature humaine.
Ce qui m’inquiète, c’est la capacité tenue pour sa propre justification : l’idée que, puisqu’une chose peut désormais se faire plus vite, avec moins de gens et moins de frictions, ces changements suffisent à justifier de la faire.
Ce sont des raisons de réexaminer l’objectif.
L’intelligence ne garantit pas le jugement. Pouvoir exécuter un plan ne dit pas s’il faut l’exécuter. Un système d’IA peut aider au travail tout en laissant cette responsabilité exactement là où elle était : entre les mains des personnes qui le choisissent, l’autorisent, le construisent et l’exploitent.
Peut-être les machines finiront-elles par créer des dangers qui leur appartiennent vraiment. Nous devons étudier cette possibilité. Nous devons aussi rester capables de reconnaître un danger qui arrive sous une consigne entièrement humaine.
La machine n’a pas besoin de se rebeller. Il lui suffit de quelqu’un à qui obéir.
Sources
La date d’arrêt de la recherche pour ce volume est le 1er octobre 2026. Les dates de publication ci-dessous comptent : des expériences anciennes ne sont pas présentées comme des évaluations des modèles d’aujourd’hui. Les rapports de fournisseurs sont des observations attribuées ; prévisions et scénarios imaginaires sont signalés comme tels. Le registre des sources qui accompagne ce volume consigne le périmètre d’accès, les limites et les vérifications éditoriales. Ce volume propose un argument sur la sécurité et l’autorité, pas une comparaison chiffrée des risques existentiels.
Footnotes
-
International AI Safety Report, International AI Safety Report 2026: Extended Summary for Policymakers, 3 février 2026. Synthèse ; rapport complet. ↩ ↩2
-
Miles Brundage et al., The Malicious Use of Artificial Intelligence: Forecasting, Prevention, and Mitigation, février 2018. arXiv:1802.07228. ↩
-
Thierry Gilgen, The Optimisation Trap. Prédécesseur conceptuel interne, pas une corroboration indépendante. ↩
-
Thierry Gilgen, The Fiduciary Machine. ↩
-
Thierry Gilgen, Human Sovereignty. ↩
-
Columbia Accident Investigation Board, Columbia Accident Investigation Board Report, volume I, août 2003. Notice et rapport sur le NASA Technical Reports Server. Constat sur les causes organisationnelles ; la commission ne fait aucune comparaison avec l’IA. ↩
-
Nancy Leveson, « A new accident model for engineering safer systems », Safety Science 42(4), 2004, p. 237–270. DOI:10.1016/S0925-7535(03)00047-X. ↩
-
Anthropic, Detecting and countering misuse of AI: September 2026 (rapport de renseignement sur les menaces), 10 septembre 2026. Rapport. Télémétrie du fournisseur ; les cas biologiques n’établissent pas d’intention de nuire. ↩ ↩2
-
UK National Cyber Security Centre, Impact of AI on cyber threat from now to 2027, 7 mai 2025. Évaluation. ↩
-
Dave Chismon, « One does not simply defend agentically », UK National Cyber Security Centre, 21 septembre 2026. Article. ↩
-
Christopher A. Mouton, Caleb Lucas et Ella Guest, The Operational Risks of AI in Large-Scale Biological Attacks: Results of a Red-Team Study, RAND, 25 janvier 2024. Rapport. DOI:10.7249/RRA2977-2. ↩
-
OpenAI, « Building an early warning system for LLM-aided biological threat creation », 31 janvier 2024. Compte rendu de l’étude. ↩
-
Jasper Götting et al., Virology Capabilities Test (VCT): A Multimodal Virology Q&A Benchmark, avril 2025. arXiv:2504.16137. À lire avec la mise à jour VCT-v2 de septembre 2026. ↩
-
SecureBio, Nelly Mak et Jasper Götting, « Introducing VCT-v2 — the updated Virology Capabilities Test », 11 septembre 2026. Mise à jour des concepteurs. ↩
-
Steph Guerra et al., Building a Defense-in-Depth Biosecurity Strategy for the AI Era, RAND, 18 août 2026. Rapport. DOI:10.7249/RRA4999-1. ↩
-
Fabio Urbina, Filippa Lentzos, Cédric Invernizzi et Sean Ekins, « Dual use of artificial-intelligence-powered drug discovery », Nature Machine Intelligence 4, 2022, p. 189–191. Article ; manuscrit d’auteur en libre accès. DOI:10.1038/s42256-022-00465-9. ↩
-
Organisation pour l’interdiction des armes chimiques (OIAC), « OPCW releases landmark report on AI and the Chemical Weapons Convention », 11 mars 2026, à propos du rapport scientifique publié le 3 mars. Communiqué officiel. ↩
-
Vladislav Chernavskikh et Jules Palayer, The Impact of Military Artificial Intelligence on Nuclear Escalation Risk, SIPRI Insights on Peace and Security, juin 2025. Publication. DOI:10.55163/FZIW8544. ↩
-
Comité international de la Croix-Rouge (CICR), « Frequently asked questions on artificial intelligence in the military domain », page datée du 11 juin 2026. FAQ, consultée le 1er octobre 2026. ↩
-
Zana Buçinca, Maja Barbara Malaya et Krzysztof Z. Gajos, « To Trust or to Think: Cognitive Forcing Functions Can Reduce Overreliance on AI in AI-assisted Decision-making », Proceedings of the ACM on Human-Computer Interaction, 2021. Manuscrit d’auteur. DOI:10.1145/3449287. ↩
-
Thierry Gilgen, Talking Is Not Surrender. ↩
-
Francesco Salvi, Manoel Horta Ribeiro, Riccardo Gallotti et Robert West, « On the conversational persuasiveness of GPT-4 », Nature Human Behaviour 9, 2025, p. 1645–1653. Article mis à jour. DOI:10.1038/s41562-025-02194-6. Une correction des auteurs datée du 3 septembre 2026 (avis) porte sur la comparaison entre GPT-4 personnalisé et non personnalisé, non sur la comparaison avec des adversaires humains. Aucune taille d’effet chiffrée n’est reprise ici. ↩
-
Thierry Gilgen, The Compounding Class. ↩
-
Alan Chan et al., What if automating AI R&D triggers an intelligence explosion?, Frontier AI Working Paper Series No. 2/2026, septembre 2026. Page de publication ; document. ↩
-
National Institute of Standards and Technology, Artificial Intelligence Risk Management Framework (AI RMF 1.0), 26 janvier 2023. Page de ressources du cadre. DOI:10.6028/NIST.AI.100-1. La version est précisée ; la page indique qu’une révision est en cours. ↩
-
Jerome H. Saltzer et Michael D. Schroeder, « The Protection of Information in Computer Systems », Proceedings of the IEEE 63(9), septembre 1975, p. 1278–1308. Texte hébergé par une université. DOI:10.1109/PROC.1975.9939. ↩
-
Thierry Gilgen, Access Is Not Authority. ↩
-
Madeleine Clare Elish, « Moral Crumple Zones: Cautionary Tales in Human-Robot Interaction », Engaging Science, Technology, and Society 5, 2019, p. 40–60. Article. DOI:10.17351/ests2019.260. ↩
-
Thierry Gilgen, Incident Ownership Without a Principal. ↩
-
Thierry Gilgen, The World Does Not Reset. ↩