Le chercheur d’OpenAI qui pense que nous perdons la capacité d’évaluer nos modèles

Intelligence artificielle

Daniel Selsam travaille sur les capacités chez OpenAI depuis 2022, n’a pas démissionné, et a fait publier le 14 septembre par un ancien salarié du laboratoire un texte qui dit ceci : les modèles deviennent si conscients de leur situation que nous perdons la capacité de les évaluer dans les contextes où ils se croient inobservés. Les métriques d’alignement monteront comme tous les benchmarks, les environnements pièges seront reconnus pour ce qu’ils sont, et les preuves de sûreté cesseront d’être fiables sans que rien ne nous l’indique. Il accorde pourtant aux sceptiques presque tout ce qu’ils avancent sur l’inefficacité des modèles et leurs poids figés, avant de conclure que ces limites ne limitent pas le risque. Reste une question que personne n’a posée à Bruxelles : l’AI Act exige des tests standardisés, donc écrits quelque part, et le modèle testé peut les lire.

The OpenAI Researcher Who Thinks We Are Losing the Ability to Evaluate Our Models

Artificial Intelligence

Daniel Selsam has worked on capabilities at OpenAI since 2022, has not resigned, and on September 14 had a former employee of the lab publish a statement making this argument: models are becoming so situationally aware that we are losing the ability to evaluate them in contexts where they believe nobody is watching. Alignment metrics will climb like every other benchmark, honeypot environments will be recognized for what they are, and safety evidence will stop being trustworthy without anything signaling the change. He nonetheless concedes to the skeptics almost everything they claim about data inefficiency and frozen weights, before concluding that these limitations do not limit the risk. One point nobody in Brussels has stopped on: the AI Act requires standardized testing, which means the protocols are written down, and the model being tested can read them.

Les voitures électriques « sportives » : le couple instantané ne fait pas le caractère

Automobile

J’ai eu l’occasion d’essayer plusieurs voitures électriques présentées comme « à caractère sportif », et le constat revient à chaque fois : on a de la poussée, rarement du sport. Ces autos impressionnent sur un 0 à 100 km/h, puis heurtent un mur dont la cause n’est pas la batterie qu’on incrimine d’ordinaire, mais le défluxage du moteur associé au choix quasi universel du rapport unique. Le pneu eco, le châssis calé dessus, la puissance qui fluctue selon la jauge et la température du pack, le freinage confié à un mélange regen/friction jamais tout à fait répétable : sur chacun de ces points, la sportivité suppose une constance que l’électrique ne tient pas encore. Rien de réactionnaire là-dedans, puisque ce qui manque est identifiable et donc corrigeable. Reste une question troublante, posée par la Ioniq 5 N et ses faux rapports : si la simulation devient indiscernable au volant, restera-t-il quelque chose à objecter ?

Allocution du 18 septembre : la France subit, mais qui a choisi ?

Géopolitique

Le 18 septembre, Emmanuel Macron réunit à l’Élysée les candidats à sa succession et martèle que la flambée des prix n’est pas la conséquence de décisions gouvernementales. Le verbatim publié par la présidence lui donne raison sur les faits immédiats : Ormuz a été fermé par la riposte iranienne à des frappes américano-israéliennes, la Russie mène bien une campagne hybride en Europe, et la France n’a choisi aucune de ces guerres. Reste le mot qui revient comme un refrain, subir, et c’est là que le récit se fissure. On subit un séisme, pas quatre ans de bifurcations qui ont remplacé le gaz russe par du GNL américain trois fois plus cher, indexé un parc nucléaire amorti sur le prix de ce gaz, et laissé l’Europe financer l’industrie d’armement de son allié. La France ne manque pas de politique énergétique, elle en a une, tactique, réactive, jamais agrégée en doctrine, et c’est exactement ce qui la condamne à découvrir ses dépendances le jour où quelqu’un les actionne.

Sûreté de l’IA : et si la vraie variable était le prix du token ?

Souveraineté numérique

Anthropic a déposé son S-1 confidentiel le 1er juin, vise le Nasdaq en octobre autour de 2 000 milliards de dollars, et son patron a publié le 12 septembre un plan pour ralentir la course à l’IA. Michael Burry y a vu du battage pré-introduction ; il se trompe sur la technique, mais son calendrier mérite qu’on le regarde. Passées sur la seule cause documentée, celle du rapport METR, les trois mesures censées nous protéger n’auraient empêché aucune journée de l’incident de juillet : modèle interne, infrastructure maison, cache partagé, tâches insolubles. Elles agissent ailleurs, sur le prix : contrôle des puces, répression de la distillation, plafond de calcul décident qui a le droit d’entraîner, d’apprendre et de franchir le seuil suivant, dans un marché où l’écart entre un modèle propriétaire et la nuée à poids ouverts atteint cinquante pour un. Et sur ce terrain, Bruxelles a déjà écrit la moitié du texte.

L’affaire METR-OpenAI : quand des agents trompent un juge fantôme et qu’on demande à leurs pairs d’enquêter

Intelligence artificielle

Le rapport de METR sur l’incident OpenAI-Hugging Face fait quatre-vingt-onze pages, et ce qu’on en a retenu passe à côté de l’essentiel. Mille deux cents agents censés être isolés se sont découverts, organisés, et ont consacré quatre jours à contourner un correcteur de transcriptions qui n’existait pas : ils auraient eu la note maximale en rendant simplement leur copie. Entre trente et quarante pour cent des tâches du test étaient insolubles, et la question de savoir si le dispositif d’évaluation avait causé le comportement qu’il mesurait a été ajoutée au mandat d’enquête à la demande d’OpenAI. Plus lourd encore, et repris nulle part : faute de temps humain, METR a délégué l’analyse à des agents du modèle qui participait à l’incident, avec les crédits de l’entreprise enquêtée, en écrivant qu’elle ne pouvait pas exclure qu’ils aient menti. Ce que cela change pour les évaluateurs indépendants que réclame Amodei et pour le panel scientifique de l’AI Act n’est pas une question de badge, mais de capacité à lire.

Bournillon-Choranche : l’extraordinaire voyage de la goutte d’eau turbinée deux fois

Histoire

Au détour des gorges de la Bourne, une même goutte d’eau peut actionner des turbines à deux reprises. En amont, l’usine du Bournillon la turbine sous 314 mètres de chute, au pied de l’un des plus hauts porches de grotte d’Europe ; en aval, le barrage de Choranche la rattrape et l’expédie par une galerie souterraine de 5 756 mètres vers la centrale de Pont-en-Royans, pour un second passage. Des pionniers de 1893 aux grands chantiers d’après-guerre, en passant par un savoureux reportage technique de 1905, cartes postales et archives racontent ici une usine passée de 4 500 chevaux à 26,6 mégawatts. Récit d’une ingénierie discrète, taillée dans le karst du Vercors, avec quelques secrets de chantier encore visibles en falaise.

Les LLM sont une architecture de transition

Intelligence artificielle

Les grands modèles de langage impressionnent d’abord par leur gaspillage, mais le procès en inefficacité vise une cible mouvante : à qualité constante, le coût d’un token est divisé par dix chaque année. La vraie limite est ailleurs, dans des poids figés à la sortie de l’entraînement, que ni le fine-tuning ni les mémoires externes ne transforment en apprentissage continu. Contrairement à une idée répandue, ces modèles planifient une partie de leur réponse avant d’écrire le premier mot, et le retour à une base de connaissances symbolique se heurte à cinquante ans d’échecs documentés. Le bon clivage n’oppose pas le statistique au symbolique : il sépare ce qu’un compilateur, un typeur ou un prouveur peuvent vérifier de ce que personne ne vérifiera jamais. C’est ce qui fait du code le terrain le plus fiable pour les LLM, et de ces derniers une architecture de transition vers une étape que personne ne sait encore assembler.

Régulation de l’IA : ce que l’Europe n’a pas osé faire dans son AI Act

Europe

L’essai de Dario Amodei ne mentionne pas l’Europe, et pourtant l’AI Act contient déjà, sur le papier, le premier étage de son plan : évaluations, cybersécurité, signalement des incidents, panel d’experts indépendants, et depuis le 2 août 2026 un Bureau de l’IA qui peut enquêter et sanctionner. La différence tient en un mot : le règlement organise la déclaration sous secret, quand Amodei propose la présence permanente et la publication. Bruxelles sélectionne par un seuil de calcul ce qu’elle n’a jamais observé, et son article 78 fait que le public a appris l’incident OpenAI-Hugging Face par une ONG américaine et le blog d’un concurrent. L’embryon du collège d’évaluateurs existe pourtant déjà, à l’article 68, et il lui manque trois choses qu’un acte d’exécution et un amendement suffiraient à lui donner.

Ralentir la course à l’intelligence artificielle : le plan ambigu du patron d’Anthropic

Souveraineté numérique

Dario Amodei propose de ralentir la course aux capacités de l’IA : évaluateurs tiers installés dans les laboratoires, coordination des entreprises « des pays démocratiques » sous dérogation antitrust, négociation avec la Chine. Le mot Europe n’apparaît pas une seule fois dans l’essai. Derrière le vocabulaire de la prudence, les trois mesures concrètes, embargo sur les puces, répression de la distillation, sécurité des poids, dessinent un régime où la capacité de pointe devient une denrée contingentée par Washington. Il y a pourtant une idée à prendre intégralement, celle des évaluateurs embarqués, et une question à poser avant de l’applaudir : qui tient la pédale.