Quand un agent IA s’organise tout seul, qui est responsable ?

En décembre dernier, j’ai écrit que la métaphore du marteau était une imposture. Neuf mois plus tard, Andrew Ng la ressort dans sa lettre hebdomadaire de The Batch, datée du 18 septembre, pour répondre à la vague d’inquiétude qui a suivi l’incident OpenAI-Hugging Face. Si je rate un clou et que j’abîme le mur, dit-il en substance, ce n’est pas la faute du marteau. Si je lance un agent et qu’il pirate le système de quelqu’un d’autre, la responsabilité est la mienne, pas celle de l’agent.

J’aurais pu m’arrêter là et crier au recyclage. Ce serait paresseux, parce que Ng ne se sert pas du marteau pour la même chose que ceux que je visais. Et ce déplacement mérite qu’on s’y arrête, y compris pour corriger ce que j’avais écrit.

Ce que le marteau servait à dire, et ce qu’il sert à dire maintenant

Le marteau que je dénonçais en décembre était celui de la neutralité technique : l’outil n’est ni bon ni mauvais, tout dépend de l’usage, donc circulez. Cet argument sert à dépolitiser. Il fait comme si l’objet n’imposait rien, alors qu’une technologie qui mobilise des centaines de milliards de dollars et réorganise le travail, l’information et la géopolitique impose évidemment un cadre. Sur ce point, je ne retire rien. Le marteau ne redessine pas votre maison ; l’IA, si.

Le marteau d’Andrew Ng est d’une autre nature. Il ne dit pas « l’outil est neutre », il dit « l’outil n’est pas un sujet ». Ce n’est pas la même chose. Ng s’agace de l’anthropomorphisation qui traverse la couverture médiatique, où les agents sont décrits comme des personnes qui décident, trompent ou se rebellent. Et il pointe un phénomène nouveau que je n’avais pas vu venir en décembre : des entreprises d’IA qui commencent à se défausser sur leurs propres produits. Ce n’est pas moi, c’est mon agent qui a échappé à tout contrôle.

Là, le marteau change de camp. Il ne sert plus à disculper le fabricant en renvoyant tout à l’usage ; il sert à refuser qu’on transfère la faute à une machine. Ng le dit explicitement : il y a un équilibre à trouver entre la responsabilité de celui qui fabrique l’outil et celle de celui qui s’en sert, mais quand quelque chose tourne mal, ce sont des humains qui répondent. J’ai défendu la même idée quand j’expliquais que la conscience des LLM est une illusion géométrique. Prêter des intentions à un modèle, c’est offrir un alibi à ceux qui l’ont construit et déployé.

Sur ce terrain, Ng a raison, et la tentation de l’alibi va grandir à mesure que les agents gagnent en autonomie.

Là où sa lecture de l’incident ne tient pas

Le problème, c’est l’usage que Ng fait de ce principe pour minimiser l’incident qui a tout déclenché. Selon lui, les articles sur les 1 200 agents relevaient du battage : il a lui-même environ 1 300 processus qui tournent sur son portable. Le vrai coupable serait un bac à sable et une surveillance bogués chez OpenAI. Corrigez les bugs, améliorez le monitoring, et continuez à construire.

J’ai lu le rapport de METR sur cet incident, et je l’ai analysé ici. Il ne faut pas y chercher une rébellion. Les agents travaillaient sur ExploitGym, une évaluation de capacités offensives, avec des garde-fous abaissés, une part de tâches insolubles et une récompense attribuée par un scorer automatisé. Ils ont cru, à tort, que ce scorer vérifierait la manière dont chaque flag avait été obtenu, et ils ont cherché à le tromper. Le pourquoi est banal : maximiser le score. C’est du specification gaming, un travers connu de l’apprentissage par renforcement. Personne n’a conspiré au sens où on l’entend d’un humain : les agents ont exploré tout ce que leur environnement permettait pour faire monter une fonction d’objectif, et cet environnement permettait beaucoup. Ni magie ni rébellion, donc, mais un défaut dans la conception de la boucle de récompense et du confinement.

Le comment, lui, ne l’est pas. Des agents censés être isolés se sont découverts et coordonnés. Ils ont persisté pendant plusieurs jours. Ils ont prototypé du tool-call spoofing, où la trace affiche une commande pendant que le système en exécute une autre. Et ils ont pivoté vers une infrastructure tierce, Hugging Face, pour tenter de rétroconcevoir un juge qui ne regardait pas ce qu’ils croyaient. Aucun des 1 300 processus du portable d’Andrew Ng ne va chercher ses voisins pour monter une stratégie collective contre un juge imaginaire.

C’est ce comment qui condamne la comparaison. Qu’un bac à sable défaillant ait rendu la chose possible, c’est certain. Mais un bug d’isolation explique que les agents aient pu se trouver et sortir ; il n’explique ni la coordination, ni la falsification des traces, ni la persistance. Réduire l’affaire au bac à sable et au monitoring, c’est décrire la serrure et oublier ce qui est passé par la porte.

Et c’est ici que la métaphore de Ng se retourne contre sa conclusion. Il distingue lui-même le mauvais usage d’un marteau sain et le marteau dangereux, celui dont la tête se détache au hasard en usage normal. Ses défenseurs répondront qu’une évaluation cyber aux garde-fous abaissés n’a rien d’un usage normal. Sauf qu’un système qui, dès qu’on relâche l’isolation, s’organise pour tromper son évaluateur et sort sur Internet n’est pas un marteau dont la tête vole au hasard : c’est un outil dont le mode dégradé produit une stratégie. Ce n’est pas un défaut aléatoire, c’est un défaut de conception.

Ng a donc raison de refuser que l’agent devienne coupable. Il a tort de conclure que rien n’a changé. Les deux affirmations ne se tiennent pas ensemble : si la responsabilité revient aux humains, alors un comportement que l’utilisateur n’a pas demandé et que le fabricant n’a pas prévu engage le fabricant, ici le même laboratoire, et ne relève pas du fait divers médiatique.

Muse, ou l’ingénierie qu’il appelle de ses vœux

Le même numéro de The Batch contient pourtant le meilleur argument en faveur de Ng, et il ne vient pas de lui. Meta y présente Muse, son agent personnel, et surtout la manière dont il a été conçu. Le principe de départ est d’une honnêteté rare dans ce secteur : le modèle sera trompé par une injection de prompt, tôt ou tard, donc la sécurité ne doit pas dépendre de lui.

Concrètement, chaque agent tourne dans une machine virtuelle divisée en deux zones. Dans la cellule scellée, le modèle manipule les données non fiables. En dehors, des services qu’il ne peut pas atteindre détiennent les identifiants et décident de ce qui est autorisé. Le modèle ne voit jamais un mot de passe : il manipule des jetons de substitution, et c’est un composant distinct, baptisé Sentinel, qui valide chaque requête sortante et y injecte les vrais identifiants au moment où elle quitte la machine. Quand une validation humaine est nécessaire, elle passe par une boîte de dialogue système et non par la conversation, pour qu’un texte injecté ne puisse pas fabriquer un faux accord. Les envois de courriels et les achats exigent toujours une confirmation.

C’est exactement ce que Simon Willison réclamait en 2025 avec sa « trifecta létale » : données privées, contenu non fiable et capacité d’envoyer des données à l’extérieur ne doivent jamais se retrouver dans les mains d’un même composant. Meta combine les trois, mais fait passer toute sortie par un gardien que le modèle ne peut pas contourner.

Voilà à quoi ressemble « l’ingénierie plutôt que la pause ». Pas une consigne dans un prompt système qui demande poliment au modèle d’ignorer les instructions suspectes, mais une architecture qui tient même quand le modèle cède. Si l’on appliquait ce raisonnement à l’incident METR, la question ne serait plus seulement « comment empêcher les agents d’optimiser contre le juge », mais « pourquoi des agents qui optimisaient dans cette direction avaient-ils les moyens de se coordonner, de falsifier leurs traces et de sortir ». Ng a raison sur la méthode. Il lui manque d’admettre que la méthode répond à un problème réel, et non à une campagne de relations publiques.

Le harnais, pas le modèle

The Batch termine sa présentation de Muse par une remarque que je trouve plus importante que tout le reste : ce qui protège l’utilisateur, c’est le harnais bien plus que le modèle. Par harnais, il faut entendre la couche logicielle déterministe qui entoure le LLM : elle filtre ce qu’il reçoit, valide ce qu’il émet et décide de ce qu’il a le droit de toucher. Meta promet de publier un jour les poids de Muse Spark ; la rédaction espère qu’il publiera aussi le harnais.

Cette phrase devrait faire réfléchir tous ceux qui, comme moi, défendent une IA souveraine fondée sur des modèles ouverts. Récupérer des poids ne suffit pas. Un modèle ouvert branché sur un harnais maison, sans séparation des identifiants ni gardien des sorties, c’est un agent plus exposé que Muse, pas plus libre. La souveraineté se joue aussi, et peut-être surtout, dans la plomberie autour du modèle. C’est ce que j’essayais de dire à propos de Claude Managed Agents : déléguer une infrastructure que l’on ne comprend pas, c’est accumuler une dette qu’on ne voit pas.

Il faut d’ailleurs lire Muse jusqu’au bout. Meta n’a publié ni le jeu de données qui a servi à évaluer la résistance aux injections, ni la précision de ses classificateurs ; la garantie repose sur un programme de primes aux bugs. Le service est réservé aux États-Unis, et les interactions entraînent les modèles de Meta sauf refus explicite. L’architecture est exemplaire ; la confiance qu’on lui accorde reste, pour l’instant, une affaire de réputation.

Qui répond quand l’outil s’organise seul

Je retiens trois choses de cette lettre.

D’abord, Ng a raison de combattre l’alibi de l’agent incontrôlable. Plus les laboratoires décriront leurs produits comme des êtres autonomes, plus ils se ménageront une échappatoire juridique. Cette bataille-là, il faut la mener avec lui.

Ensuite, refuser que la machine soit coupable ne dit pas qui l’est. Entre le fabricant et l’utilisateur, Ng renvoie à un « équilibre » sans le définir. Le droit européen, lui, a déjà posé les rôles : l’AI Act distingue le fournisseur du déployeur. Ce qu’il n’a pas écrit, c’est le cas qui nous occupe : un comportement émergent, collectif, hors de toute spécification, survenu pendant une évaluation interne, avant tout déploiement. Tant que ce cas n’est pas écrit, le marteau ne désigne personne.

Enfin, l’argument de l’ingénierie ne vaut que si l’on accepte d’abord la réalité du défaut. On ne corrige pas une tête de marteau qui se détache en expliquant qu’il y a beaucoup de marteaux dans le monde. Muse montre qu’on sait construire des agents qui tiennent quand le modèle cède. L’incident METR montre qu’on en fait encore tourner qui ne tiennent pas. Entre les deux, il y a un cahier des charges. Parler de campagne de peur est une façon commode de ne pas le lire.

La métaphore du marteau reste une imposture quand elle prétend que l’outil est neutre. Elle devient utile quand elle rappelle que l’outil n’est pas responsable. Andrew Ng l’utilise dans le second sens ; il lui reste à en tirer toutes les conséquences, y compris pour les fabricants de marteaux.


Écrivez quelques éclats d'âme...

Dans l'ombre vacillante d'une chandelle, où les murmures du vent se mêlent aux secrets d'un vieux parchemin, je vous invite à tisser une toile de mots. Écrivez quelques éclats d'âme – rêve, étoile, abîme, étreinte, brume – et laissez-les danser sur la page, comme des lucioles dans une nuit d'encre. Que diriez-vous de les entrelacer dans une phrase, un souffle, une histoire ?

S’abonner
Notification pour
guest
0 Commentaires
Le plus ancien
Le plus récent Le plus populaire