Mistral Large 4 : le Chonk ne règle pas la souveraineté, il règle la facture
Ce qui a été annoncé
Les faits d’abord, sans adjectif. Mistral Large 4 est un modèle à mélange d’experts de 1,05 billion de paramètres, dont 52 milliards actifs à chaque token, doté d’un encodeur visuel et d’une fenêtre de contexte d’un million de tokens. Son prédécesseur, Large 3, sorti en décembre 2025, plafonnait à 675 milliards. Il a été entraîné de zéro sur 3 800 GPU Nvidia Grace Blackwell, dans les datacenters de Mistral « en Europe » (l’entreprise ne précise pas le pays), et la préversion est servie sur la même infrastructure.
Il est disponible en préversion par l’API, au prix catalogue de 1,36 dollar par million de tokens en entrée et 4,18 dollars en sortie, actuellement divisé par deux en promotion. Les poids doivent être publiés d’ici la fin du mois.
C’est le premier modèle phare que la promesse des datacenters maison, celle pour laquelle Mistral s’est endettée à 830 millions, transforme en produit. Rien que pour cela, l’annonce compte.
Ce que j’écrivais le 23 septembre, et ce qui a changé
Ma thèse tenait en une phrase : en hébergeant des modèles tiers, à commencer par le chinois GLM, Mistral glissait du laboratoire vers la plateforme, et réduisait la souveraineté à un point d’accès européen. Le Chonk semble me contredire. Une entreprise qui ne serait plus qu’un guichet n’entraînerait pas un modèle d’un billion de paramètres sur ses propres machines.
Sauf qu’il suffit d’ouvrir la fiche de Mistral Large 4 dans la documentation officielle. Sous la rubrique « autres modèles », on trouve GLM-5.3 et GLM-5.2. La page qui présente le fleuron de la souveraineté européenne renvoie, trois lignes plus bas, vers les modèles de Zhipu.
Les deux lectures sont donc vraies en même temps. Mistral sait encore construire, et Mistral vend déjà la production des autres. C’est précisément cette coexistence qu’il faut regarder, au lieu de choisir son camp entre les pleureuses et les thuriféraires.
Le bon étalon n’est pas Opus, c’est DeepSeek
Une partie des réactions s’est empressée de comparer le Chonk aux modèles phares américains, pour constater qu’il est derrière. C’est vrai. L’indice d’intelligence d’Artificial Analysis le place à 38 points, entre DeepSeek V4.1 Flash et GPT-6 Luna, l’entrée de gamme d’OpenAI. En évaluation humaine à l’aveugle sur la qualité du code, il arrive deuxième sur cinq, nettement derrière Claude Opus 5.
C’est vrai, et c’est hors sujet. Mistral elle-même ne se compare quasiment jamais aux Américains : ses benchmarks l’opposent à DeepSeek V4 Pro, Kimi K3, GLM-5.3 et Qwen3.8 Max. Son ambition affichée est d’être le meilleur modèle ouvert hors de Chine, et sur ce terrain elle l’est. Le saut est d’ailleurs spectaculaire : le même indice donnait 9 points à Large 3 et 14 à Large 3.5.
Il circule sur les réseaux une thèse séduisante : le Chonk serait aussi bon que ce que les Américains produisent à puissance de calcul égale, l’écart ne tiendrait donc plus qu’à la taille des centres de calcul. Elle est plausible. Elle n’est pas démontrée : personne ne publie de comparaison à calcul égal, et Mistral ne la revendique pas. Ce qui est établi est plus modeste et plus utile : Mistral fait désormais jeu égal avec les laboratoires chinois, qui travaillent eux aussi sous contrainte de calcul.
Et sur le terrain où se trouve la masse des usages, le travail de bureau, l’écart se referme. Sur les tâches juridiques et financières évaluées par Vals.ai, Mistral annonce le Chonk devant GPT-6 Astra. C’est exactement ce que j’appelais le théorème du suffisamment bon : la pointe reste américaine, mais l’écrasante majorité des usages bascule dès qu’un modèle est assez bon pour un prix bien inférieur.
La cybersécurité, ou la souveraineté par le refus des autres
C’est le point le plus solide de l’annonce, et il est plus subtil que ce qu’on en dit.
Le Chonk figure dans le top 5 mondial de l’indice cyber d’Artificial Analysis, une évaluation indépendante de la capacité à trouver et corriger des failles dans du logiciel réel. Sur l’un de ses tests, qui consiste à reproduire une vulnérabilité puis à la corriger, il obtient 82 %, le meilleur score toutes catégories.
Mais Mistral l’écrit elle-même, et c’est le passage le plus intéressant de son annonce : Claude Opus 5.5 et GPT-6 Astra obtiennent un score proche de zéro sur ce même test, parce qu’ils refusent la tâche. Une partie de l’avance ne relève donc pas de la capacité brute, mais de la politique de modération.
Ce n’est pas un détail qui affaiblit l’argument, c’est ce qui le rend décisif. Pour un défenseur, prouver qu’une faille est réelle est souvent la première étape de la correction. Un modèle qui refuse ce travail en pleine crise, parce qu’un comité californien a jugé la requête trop proche de l’offensive, est une vulnérabilité. La dépendance numérique ne se mesure pas seulement au risque qu’on vous coupe l’accès : elle se mesure aussi aux décisions de modération prises ailleurs, selon des critères que vous ne contrôlez pas. Ajoutez des poids téléchargeables et un déploiement sur site, et vous obtenez ce que l’État cherchait en signant l’accord-cadre avec les Armées en janvier.
Une question reste toutefois sans réponse. Pendant la phase de test, des experts en cybersécurité, des partenaires vérifiés et des autorités publiques accèdent au même modèle avec une modération réduite et des capacités cyber étendues. Qui décide de cette liste, selon quels critères, avec quelle traçabilité ? Un outil offensif à accès discrétionnaire n’est souverain que s’il est contrôlé. Sans réponse claire, on aura simplement déplacé le comité de modération de San Francisco à Paris.
La balance des paiements, l’argument que personne ne chiffre
Voici à mon sens le cœur du sujet, et la raison pour laquelle ce modèle compte davantage que son classement.
On parle de souveraineté de l’IA en termes de données (qui les lit ?) et de dépendance (qui peut couper ?). On oublie la troisième dimension, la plus prosaïque : qui encaisse ? Chaque abonnement, chaque million de tokens consommé par une entreprise française auprès d’un fournisseur américain est une importation de services. Et cette importation ne s’ajoute pas seulement aux dépenses existantes : de plus en plus, elle se substitue à de la masse salariale. Quand un service comptable, juridique ou marketing réduit ses effectifs grâce à un agent, la valeur ajoutée qui rémunérait des salariés français part rémunérer des serveurs et des actionnaires de l’autre côté de l’Atlantique.
Les ordres de grandeur suffisent à mesurer l’asymétrie. En mai 2026, le chiffre d’affaires annualisé d’Anthropic atteignait 47 milliards de dollars. Celui de Mistral tournait autour de 400 millions de dollars au début de l’année, avec un objectif d’un milliard fin 2026. Une partie de ces 47 milliards vient d’Europe, et donc de France.
Or, pour ces usages, la course à la frontière n’est pas infinie. Les progrès des modèles de pointe resteront décisifs pour la recherche scientifique et pour des usages très avancés. Ils ne le sont plus pour remplir un tableur financier, rédiger une note juridique ou trier des tickets de support. Sur ce terrain, le Chonk est déjà au niveau. Le jour où un modèle européen suffit à faire tourner l’essentiel des fonctions tertiaires d’une entreprise, l’hémorragie devient un choix, et non plus une fatalité technique.
Il faut toutefois dire ce que cet argument ne règle pas, sous peine de verser dans le chauvinisme comptable. Les 3 800 GPU sont des Nvidia, et l’investissement matériel repart donc en partie en Californie. La série D de 3 milliards d’euros a été menée par Samsung, après une série C menée par le néerlandais ASML : les dividendes futurs ne resteront pas tous en France. Le prix promotionnel actuel n’est pas un prix durable. Surtout, un modèle français ne retient le cash que s’il est adopté. Mistral revendique plus de 125 entreprises clientes dans 20 pays et un partenariat avec Accenture, mais un champion national sur l’étagère n’a jamais rééquilibré une balance commerciale.
C’est la même logique que je décrivais à propos de l’IA locale, qu’on paie trois fois : la facture la plus lourde n’est pas toujours celle qu’on voit.
La dissuasion par la suffisance
Pour comprendre ce que la France peut viser, l’analogie la plus juste est militaire. Notre dissuasion nucléaire n’a jamais cherché la parité avec les arsenaux américain ou russe. Elle cherchait un seuil : celui au-delà duquel nous attaquer coûterait plus cher que ce que l’agresseur pourrait y gagner. La puissance ne se mesure pas à la taille de l’arsenal, mais à l’autonomie de son emploi.
Appliquée à l’IA, la grille est la même. La France n’a pas besoin du meilleur modèle du monde. Elle a besoin d’un modèle suffisant, entraîné et servi chez elle, qu’elle peut employer sans demander la permission à personne : pour défendre ses réseaux, faire tourner son administration et son industrie, et ne pas laisser sa richesse fuir à chaque requête. C’est le raisonnement que Dassault tient depuis des décennies, et que j’ai défendu à propos du SCAF.
Mais l’analogie a une exigence que les enthousiastes oublient. Une dissuasion n’est crédible que si l’arme est entre vos mains. Un arsenal stocké chez un hébergeur qui sert aussi les modèles d’un rival ne dissuade que si l’on peut le reprendre et le faire fonctionner chez soi. D’où l’importance de ce qui reste à venir.
Ce qui manque encore
La licence. La documentation classe le Chonk dans la catégorie « Open », sans publier le moindre terme. Large 3 était sous Apache 2.0, Medium 3.5 sous une licence MIT modifiée : la cohérence n’est pas garantie. Promettre des poids ouverts à trois semaines de leur publication sans dire sous quelles conditions, c’est demander une confiance qu’on n’a pas encore gagnée. J’ai appris avec Qobuz qu’une propriété révocable n’en est pas une. Une souveraineté sous licence révocable non plus.
Le harnais. La valeur se déplace vers la couche d’orchestration et d’exécution, celle qui permet au modèle d’agir dans des environnements complexes, de piloter des outils et des agents en parallèle. Je l’ai écrit à propos de Muse et de la responsabilité des agents : c’est le harnais qui fait la différence, pas le modèle. Sur ce terrain, Mistral n’a encore rien montré de comparable à ce que proposent les Américains.
Les usages. L’annonce du Chonk, c’est onze minutes de lecture et une batterie de benchmarks. On y apprend ce que le modèle mesure, beaucoup moins ce qu’il permet de faire de nouveau. Chez OpenAI ou Anthropic, chaque sortie s’accompagne d’une promesse d’usage concrète. Chez Mistral, on admire la prouesse. C’est la marque d’une entreprise dont les premiers clients sont l’État et les grands comptes, qu’il faut rassurer plutôt que séduire. Pour arrêter l’hémorragie de la section précédente, il faudra pourtant convaincre des entreprises qui, elles, ont le choix.
Mon avis
Le Chonk ne rattrape personne au sommet, et il n’en a pas besoin. Il atteint le seuil utile, sur le terrain le plus régalien qui soit, entraîné sur des machines européennes. C’est un vrai accomplissement, et il serait absurde de le bouder parce qu’il ne bat pas Opus.
Mais ma thèse du 23 septembre tient toujours : le modèle ne fait pas la souveraineté à lui seul. Elle se jouera sur trois points vérifiables dans les prochains mois. Une licence écrite et durable à la publication des poids. Un accès dérogatoire en cybersécurité encadré par des règles publiques. Et surtout, une adoption réelle par des entreprises françaises qui cessent d’envoyer leur trésorerie de l’autre côté de l’Atlantique.
Sans cela, nous aurons un champion national sur l’étagère, et une balance des paiements qui continue de saigner.