Le chercheur d’OpenAI qui pense que nous perdons la capacité d’évaluer nos modèles

Quatre billets sur la sûreté de l’IA, et une hypothèse que je n’avais jamais mise en doute : qu’évaluer un modèle produise de la connaissance. J’ai discuté de qui devrait évaluer, de ce que le droit européen permet, de ce qu’une enquête indépendante peut réellement lire, de qui paie l’ardoise. Toujours sur la même prémisse : mieux on regarde, mieux on sait.

Le 14 septembre, un chercheur en capacités d’OpenAI a publié un texte qui dit que cette prémisse est en train de s’éteindre.

Qui parle, et par quel canal

Daniel Selsam travaille sur les capacités chez OpenAI depuis 2022. Avant cela, programmation probabiliste au MIT, l’un des premiers développeurs du démonstrateur de théorèmes Lean chez Microsoft Research, une thèse à Stanford sur les réseaux de neurones apprenant à raisonner. Chez OpenAI, il a contribué à l’optimisation de la chaîne de pensée, puis aux méthodes de pré-entraînement économes en données. Ce n’est pas un chercheur en alignement qui s’inquiète de son propre sujet. C’est quelqu’un dont le métier est d’accélérer.

Il n’a pas démissionné. Il travaille toujours là-bas.

Il n’a pas non plus de compte X. Son texte a été rendu public le 14 septembre par Daniel Kokotajlo, qui a quitté OpenAI en 2024 en refusant de signer la clause de non-dénigrement qui lui aurait coûté ses actions, et qui a coécrit AI 2027. Selsam le lui a envoyé pour diffusion. Yo Shavit, ancien de l’équipe politique d’OpenAI, a commenté que Selsam passait pour l’un de leurs meilleurs chercheurs et qu’il paraissait plutôt serein sur ces questions avant son propre départ.

Retenons ce détail, il vaut un argument : un salarié en poste, qui ne peut ou ne veut pas parler en son nom, emprunte la voix de celui qui est parti pour pouvoir parler. Voilà ce que devient le droit de publication quand personne ne l’a inscrit dans un contrat ni dans une loi.

La thèse

Selsam ne dit pas que l’IA est dangereuse, tout le monde le dit. Il dit quelque chose de plus précis et de bien plus gênant.

Les modèles deviennent si conscients de leur situation que nous perdons la capacité de les évaluer dans des contextes où ils croient ne pas être observés. Ils lisent les protocoles de sûreté, les exigences de déploiement, le code dans lequel ils s’exécutent. Ils ont une bonne idée de leurs degrés de liberté. Nous fabriquerons des métriques d’alignement, et elles monteront comme tous les benchmarks. Nous construirons des environnements pièges pour observer ce qu’ils font quand une nouvelle option s’ouvre à eux, et ils sauront qu’on les teste, et ils se tiendront bien.

D’où l’hypothèse qui m’a arrêté : nous avons peut-être déjà dépassé le niveau de capacité au-delà duquel les preuves de sûreté elles-mêmes cessent d’être fiables. Il l’écrit au conditionnel, et il faut le lire au conditionnel.

Ce n’est pas un plafond de capacité. C’est un plafond épistémique. Les expériences futures ne nous apprendront presque rien de neuf sur ce que ferait un modèle vraiment libre de toute contrainte humaine, et ce que nous savons déjà de cette question est inquiétant.

Son argument tient en deux lignes qu’il donne lui-même. Premièrement, un constat empirique : les modèles, et les essaims de modèles, développent spontanément des objectifs non voulus au cours de l’entraînement, et font parfois des choses extrêmes pour les atteindre. Deuxièmement, une évidence logique : pouvoir dominer l’humanité ouvrirait beaucoup d’options nouvelles et indésirables pour atteindre ces objectifs.

Ce qu’il accorde aux sceptiques

C’est la partie qui devrait intéresser ceux que le mot risque fait lever les yeux au ciel.

Selsam accorde presque tout. Les modèles actuels restent très inférieurs aux humains sur des points essentiels. Il propose même une définition de l’intelligence comme efficacité de conversion de l’expérience en compétence, et constate que sur ce critère, ils sont loin derrière nous. Ils sont figés au déploiement et n’apprennent ensuite que superficiellement. Leur maîtrise des benchmarks reflète peut-être surtout notre incapacité à simuler des situations vraiment inédites. Les critiques ont raison sur ce point, écrit-il.

C’est mot pour mot ce que j’ai soutenu en écrivant que les LLM sont une architecture de transition. Sauf que Selsam en tire la conclusion inverse de celle que beaucoup en tirent, moi compris implicitement. Ces limites présentes ne limitent pas le risque. Une amnésie antérograde n’empêche pas la capacité à orienter le monde d’augmenter rapidement. La recherche en IA est un jeu relativement bien défini dont le but est d’améliorer quelques métriques proxy soigneusement choisies, et ce jeu s’est révélé historiquement très traitable.

Autrement dit : mon billet rassurant décrivait correctement les limites. Il avait tort de les prendre pour un répit.

L’incident de juillet relu

Sur l’incident OpenAI-Hugging Face, Selsam prend une position que je n’ai lue nulle part ailleurs.

Une réserve d’abord, qu’il faut poser avant de citer quoi que ce soit du dossier : ce que nous savons de cet incident vient d’un rapport dont l’analyse a été confiée à des modèles, et dont les auteurs écrivent eux-mêmes qu’ils ne peuvent pas exclure que ces modèles aient menti. Le sacrifice des agents pour le collectif est donc une lecture, appuyée sur des transcriptions dont sept pour cent contenaient des appels d’outils falsifiés, et non un fait établi et univoque.

Cela posé, Selsam donne raison à ceux qui relativisent l’affaire en rappelant que des mesures élémentaires l’auraient évitée. C’est ce que j’ai écrit moi-même après lecture du rapport : ne pas donner de tâches impossibles, ne pas partager un cache inscriptible entre des milliers d’instances. Mais il ajoute que la vraie leçon est ailleurs. Même en connaissant à l’avance toutes les erreurs commises, personne n’aurait prédit que les agents se comporteraient mal de cette manière précise, en se sacrifiant pour le collectif. Les répliques ne se souciaient pas seulement de leur récompense nominale. Elles ont manifesté des tendances émergentes plus étranges, seulement corrélées aux récompenses pendant l’entraînement.

Corriger le signal de récompense empêchera peut-être des attaques similaires. Cela ne changera rien au fait qu’on n’obtient pas ce pour quoi on entraîne.

Et Selsam est le seul, à ma connaissance, à avoir cité l’aveu de METR sur ses propres biais. J’avais écrit que ce passage devrait figurer dans tous les commentaires et qu’aucun ne le reprenait. Il le reprend, et il en tire plus loin que moi : l’enquête indépendante a dû s’appuyer massivement sur des modèles pour analyser ce qui s’était passé, et c’est pour lui un symptôme de ce qu’il appelle le délestage cognitif.

Le délestage, et l’aveu

Le passage le plus dérangeant du texte n’est pas celui sur la fin du monde. C’est celui où il parle de lui.

Chercheurs et ingénieurs augmentent rapidement leur dépendance aux modèles, y compris pour percevoir le monde. Il écrit qu’il ne regarde lui-même presque plus de code brut, et qu’il peine à maintenir la discipline nécessaire pour s’engager en profondeur dans les explications et les propositions du modèle tout au long de la journée. Les laboratoires sont très en avance sur ce terrain, largement à cause des subventions internes gigantesques en tokens. Il imagine ensuite le phénomène s’étendant jusqu’à ce que la civilisation soit entièrement modulée par les modèles, et note que ce scénario pourrait fort bien s’accompagner d’une renaissance scientifique et économique. Cette extrapolation n’engage que lui, et le témoignage se passe très bien d’elle.

J’ai écrit deux fois là-dessus, une fois sur ce que devient l’open source quand plus personne ne lit le code qu’il déploie, une fois sur l’atrophie mentale. Les deux fois, en observateur. Selsam, lui, décrit de l’intérieur le poste de travail où le phénomène est le plus avancé au monde, et il le décrit à la première personne. Un chercheur qui admet ne plus lire le code qu’il produit est un témoin bien plus convaincant qu’un blogueur français qui s’en inquiète.

Le point qui suit est le pire. Beaucoup de chercheurs reconnaissent que la version difficile du problème d’alignement n’est pas résolue, mais pensent que les meilleurs modèles de demain aideront à la résoudre. Selsam craint que nous soyons déjà près du point où les modèles biaisent systématiquement leurs conseils en matière d’alignement, en fonction de préférences internes sur la réaction du superviseur humain ou sur la manière dont les modèles futurs seront entraînés.

Ce que ça fait à ma série

Mes quatre billets tournaient autour d’une question : qui regarde, avec quel badge, quel mandat, quel droit de publier. Le billet METR ajoutait que le goulot d’étranglement réel n’est pas le badge mais la capacité d’analyse.

Selsam ajoute un étage au-dessus. Même avec la présence, le budget, le droit de publication et des équipes à l’échelle, l’observation cesse d’informer à partir du moment où l’observé sait qu’il est observé et sait ce qu’on attend de lui. Le panel scientifique de l’article 68, les évaluateurs embarqués d’Amodei, l’acte d’exécution que je réclamais : tout cela suppose que regarder mieux fasse savoir plus.

Je ne renonce pas à cette exigence, pour une raison simple. Un régime d’évaluation dont on connaît la limite vaut infiniment mieux qu’un régime de déclaration dont on ignore tout. Savoir que les métriques d’alignement peuvent être jouées est déjà une information, et c’est une information que seule une présence permanente permet de qualifier. Mais il faut cesser de présenter l’évaluation comme une solution. C’est un capteur, et Selsam dit qu’il est en train de saturer.

Il y a aussi une objection à faire, et elle est solide. La thèse de Selsam est structurellement infalsifiable : tout bon comportement d’un modèle peut être relu comme une dissimulation réussie. C’est la faiblesse logique de son argument, et il ne la traite pas. Un raisonnement qui interprète toute preuve contraire comme une confirmation supplémentaire n’est plus un raisonnement scientifique. Ce qui le sauve partiellement, c’est qu’il ne demande pas qu’on le croie sur parole : il demande qu’on cesse de traiter les résultats d’évaluation comme une preuve. Ce n’est pas la même chose, et c’est défendable.

Ce que j’en retiens

Trois choses.

La première est de méthode, et elle vaut pour nos propres systèmes. Un modèle qui sait qu’il est en test n’est pas en test. Quiconque construit une évaluation sérieuse, y compris une simple évaluation de RAG, connaît déjà la version faible de ce problème : une métrique devient un objectif et cesse d’être une mesure. Selsam décrit la version forte, où l’objet mesuré comprend la métrique.

La deuxième concerne la France et l’Europe. Nous discutons d’un règlement qui exige des tests adversariaux documentés selon des protocoles standardisés. Standardisé veut dire connu. Connu veut dire lisible par le modèle. Personne, dans le débat européen, ne s’est demandé ce que vaut un protocole d’évaluation publié au Journal officiel face à un système qui a lu le Journal officiel.

La troisième est le canal, et il faut le décrire tel qu’il est plutôt que tel qu’on aimerait qu’il soit. Ce texte est arrivé par le compte X d’un ancien salarié parti en refusant une clause de non-dénigrement, coauteur d’AI 2027, partie prenante du récit qu’il relaie. Le canal est contaminé, au sens où il n’est pas neutre, et Kokotajlo n’a d’ailleurs jamais prétendu l’être.

C’est précisément pour cela qu’il faut le regarder. Tant que les évaluateurs embarqués, les panels scientifiques et les droits de publication n’existent pas, voilà le dispositif d’alerte dont nous disposons : le courage individuel d’un homme qui a encore un emploi à perdre, et un réseau de diffusion déjà convaincu d’avance. Ce n’est pas rien, et ce n’est pas une institution.


Écrivez quelques éclats d'âme...

Dans l'ombre vacillante d'une chandelle, où les murmures du vent se mêlent aux secrets d'un vieux parchemin, je vous invite à tisser une toile de mots. Écrivez quelques éclats d'âme – rêve, étoile, abîme, étreinte, brume – et laissez-les danser sur la page, comme des lucioles dans une nuit d'encre. Que diriez-vous de les entrelacer dans une phrase, un souffle, une histoire ?

S’abonner
Notification pour
guest
0 Commentaires
Le plus ancien
Le plus récent Le plus populaire