Infrastructure & Données

C’est ici que se règle ce qui décide vraiment de la qualité d’un système IA : le pipeline, le stockage, l’évaluation et la facture. Cette catégorie documente le travail invisible depuis les cas réels, un PDF technique de constructeur transformé en markdown exploitable, un chunking dont l’amélioration apparente venait d’un jeu de questions biaisé, 84 000 chunks tenant dans la RAM d’un portable alors qu’on vend aux PME une pile à quatre services, une recherche vectorielle et un BM25 écrits en SQL pur plutôt que confiés à un fournisseur qui facture la donnée. Vous y trouverez le parsing visuel et pourquoi la plupart des pipelines avalent une bouillie de pixels, les métriques d’évaluation qui mentent quand on ne les regarde pas de près, les boucles agentiques et la dépendance qu’on vend avec, le coût réel de l’IA locale, machine, watts et souveraineté comprises. Écrit avec les mesures, les chiffres et les erreurs assumées, pour ceux qui doivent faire tourner ces systèmes plutôt que les présenter.

Quand la Big Tech emprunte contre l’État : le jour où l’IA a fait plier le Trésor américain

Économie

Le 19 août 2026, le Trésor américain a doublé en urgence le plafond de ses rachats de dette longue, déchirant un calendrier publié deux semaines plus tôt, au lendemain d’un plus haut de dix-neuf ans sur le taux à 30 ans. Le montant est anecdotique ; l’improvisation d’une institution dont toute la doctrine repose sur la prévisibilité ne l’est pas. Car un second emprunteur s’est invité au même guichet : les géants de l’IA, porteurs de 3 000 milliards de dollars d’engagements hors bilan qu’il faudra financer sur les mêmes échéances longues, auprès du même pool fini de fonds de pension et d’assureurs. L’État absorbe la volatilité, les hyperscalers émettent dans un marché stabilisé à ses frais, et le contribuable-emprunteur règle la différence dans son taux immobilier. La souveraineté ne se joue pas seulement dans les puces : elle se joue dans la file d’attente des emprunteurs.

ComfyUI vs n8n : pourquoi ils ne se concurrencent pas, et comment les assembler

Intelligence artificielle

ComfyUI et n8n partagent la même grammaire visuelle, des nœuds et des connexions, mais n’exercent pas le même métier : l’un fabrique des médias avec des modèles IA, l’autre orchestre des événements, des services et des règles métier. Les opposer est donc un faux débat. La vraie question est de savoir où placer la frontière entre eux, et comment les assembler dans une architecture hybride où n8n pilote ComfyUI comme un moteur de rendu asynchrone. De la sécurisation de l’API au découplage des coûts GPU, cet article pose les règles de conception, illustrées par un cas concret : une usine de traduction et de lip-sync vidéo.

IA locale : on ne la paie pas deux fois, mais trois

Intelligence artificielle

On répète que l’IA locale se paie deux fois, la machine puis les watts, et c’est vrai. Mais il manque une troisième facture, la seule qui ne se libelle pas en euros : celle de la souveraineté, que vous signez en silence dès que vous « tenez avec les API » deux ans en attendant que les prix retombent. En prime, le watt français est l’un des plus propres du continent, et la flambée mémoire qu’on vous conseille d’attendre n’est pas une météo mais une éviction parfaitement rationnelle, qui n’a aucune raison de se corriger toute seule. Complément au guide d’achat de tazmenworld, pour ajouter la ligne que le tableur oublie et rappeler que, dans un monde où la mémoire part d’abord là où la marge est la plus grasse, posséder la sienne est déjà un acte de résistance.

Les boucles d’IA : le vrai virage et la dépendance qu’on vous vend avec

Intelligence artificielle

Tout le monde répète qu’il faut désormais concevoir des boucles plutôt que prompter ses agents, et sur le fond, c’est vrai : la boucle est le vrai virage de l’IA. Mais ces discours taisent systématiquement deux coûts, celui des tokens qui se composent à chaque itération, et le plus lourd, celui de la souveraineté, puisque l’entonnoir finit toujours sur un produit propriétaire à qui vous confiez vos clés, vos données et le pouvoir d’agir en votre nom. Cet article pose proprement ce qu’est une boucle, dit quand elle est un piège plutôt qu’un gain, et montre comment la reconstruire entièrement chez soi, sur sa propre infrastructure. Parce que la seule question qui vaille n’est pas de savoir quel produit vous fait gagner du temps, mais à qui appartient la boucle.

Origin : quand la forge devient agentique, l’auto-hébergement cesse d’être un hobby

Intelligence artificielle

Le 16 juin, à sa conférence Compile, Cursor a dévoilé Origin, une forge Git pensée non plus pour les humains mais pour les nuées d’agents qui poussent du code en continu. La presse y a vu un concurrent de GitHub ; le vrai sujet est la concentration qui se referme lorsqu’un même acteur réunit le compute, le modèle, l’IDE, la forge et vos données de travail, un risque structurel qui serait identique avec n’importe quel autre géant. Face à ce point de contrôle unique, l’auto-hébergement cesse d’être une coquetterie de power user pour devenir une position stratégique, à condition de l’admettre : il ne suffira plus de stocker ses dépôts, il faudra faire tourner ses propres orchestrateurs d’agents pour ne pas être souverain mais d’une lenteur rédhibitoire. La vraie brique de sortie n’est donc pas seulement Git pour le code, c’est MCP pour l’agent, ce couple qui permet à un éditeur ouvert de restituer la même puissance sans tout confier au propriétaire dominant. Mon pari pour les trois ans qui viennent : pas une bascule, mais une polarisation, où la standardisation reste notre meilleure porte de sortie.

Suffisamment bon, cinquante fois moins cher : le théorème qui broie l’IA américaine

Intelligence artificielle

Les contrôles à l’export américains devaient étrangler l’IA chinoise ; ils lui ont appris la frugalité, et la frugalité est devenue son arme tarifaire. DeepSeek, Qwen et la nuée des modèles à poids ouverts livrent aujourd’hui un suffisamment bon à une fraction du prix occidental, ce qui suffit à faire basculer l’écrasante majorité des usages. Mais le marché n’a pas basculé là où on le croit : la pointe absolue reste américaine, et le vrai moat, la distribution, voit déjà les hyperscalers revendre la commodité chinoise sur leur propre compute. Pour l’Europe, adopter par défaut l’API de Hangzhou, c’est troquer un suzerain contre un autre, quand la seule sortie réelle, l’auto-hébergement des poids ouverts, n’a rien d’un repas gratuit. Reste à savoir si le continent saura bâtir les conditions, réglementaires et industrielles, qui font de ce réflexe autre chose qu’un geste de minorité éclairée.

Apple AFM 3 : le triomphe de l’IA embarquée… et ses renoncements

Intelligence artificielle

Le 8 juin 2026, Apple a dévoilé la troisième génération de ses Foundation Models, avec une architecture embarquée parmi les plus astucieuses du marché : AFM 3 Core Advanced stocke vingt milliards de paramètres en mémoire flash et n’en active que quelques-uns, en routant ses experts par prompt plutôt que par token. Cette prouesse n’a pourtant rien de spontané, puisqu’elle prolonge industriellement le papier « LLM in a flash » de 2023 que la communication d’Apple préfère passer sous silence. Mais derrière le génie embarqué se loge un renoncement plus lourd : les cinq modèles sont co-conçus avec Google, pré-entraînés sur ses TPU, et le plus capable d’entre eux s’exécute sur des GPU NVIDIA dans Google Cloud. L’entreprise qui avait fait de l’intégration verticale et du « designed by Apple » son dogme loue désormais sa puissance de pointe chez un concurrent, là précisément où elle avait promis le plus d’indépendance. Et pendant ce temps, le Digital Markets Act prive les Européens de Siri AI sur iPhone et iPad sans calendrier, illustration d’un continent qui excelle à réguler un match auquel il ne joue plus.

Intégrer un chatbot IA sur un site client : la grille de décision que personne ne pose

Intelligence artificielle

On me demande sans arrêt de coller un chatbot IA sur des sites clients, et ils tournent sur tout : Shopify, WordPress, Drupal, parfois du sur-mesure abandonné. Mais « quel plugin ? » n’est jamais la bonne question : un chatbot IA, ce sont deux couches qu’on confond presque toujours, la livraison du widget et le cerveau qui répond. Toute la décision tient sur une seule échelle, du clé-en-main verrouillé où vous ne contrôlez rien, jusqu’au pipeline que vous possédez entièrement. Pour un client unique, le clé-en-main suffit largement ; pour une agence qui veut capitaliser un savoir réutilisable sur toute une flotte, posséder le cerveau devient un actif. Voici la grille que j’utilise pour trancher, CMS par CMS, Shopify en tête.

MxChat sur DuckDB (MotherDuck) : recherche vectorielle + BM25 en SQL pur

Infrastructure & Données

MxChat est un bon plugin de chatbot RAG pour WordPress, mais ses deux options de stockage vectoriel sont des impasses : MySQL qui se vautre en mémoire, ou Pinecone qui facture la donnée à l’américaine. J’ai écrit un plugin compagnon qui se fait passer pour Pinecone côté MxChat, et traduit chaque appel en SQL DuckDB. Au choix : un fichier local, ou MotherDuck si on préfère le cloud sans le vendor lock. Recherche hybride BM25 + vecteur, migration depuis Pinecone sans repayer le ré-embedding, GPL v2. Encore une rente mensuelle évitée.

DuckDB : votre RAG tient dans un fichier, pas dans un cluster

Infrastructure & Données

Un PoC RAG indexant 84 000 chunks, soit environ 500 Mo de vecteurs, tient sans broncher dans la RAM d’un MacBook M1 ; pourtant on continue à vendre aux PME françaises une stack à quatre services (Pinecone + Elasticsearch + Postgres + LangChain) qui coûte entre 150 et 400 € par mois en infrastructure cloud et mobilise trois compétences techniques distinctes. DuckDB, bibliothèque analytique embarquée maintenue depuis 2019 par le CWI d’Amsterdam, règle l’équation en une seule dépendance : recherche vectorielle native (extension vss), recherche full text BM25 (extension fts), filtres structurés SQL standard et re-ranking hybride en une unique requête de huit lignes, le tout dans un fichier .duckdb local. Au bilan : facteur 10 sur le coût d’infrastructure, facteur 10 sur la latence, facteur 5 sur le temps de mise en prod, et zéro embedding qui sort de votre infrastructure pour finir dans un datacenter américain. La stack à quatre services qu’on enseigne aujourd’hui dans 90 % des tutoriels RAG n’existe pas pour résoudre un problème technique : elle existe pour vendre du SaaS récurrent, justifier des prestations DevOps et gonfler des budgets projets sur des cas d’usage qui ne le méritent pas. La vraie valeur d’un ingénieur senior en 2026 se mesure au nombre de lignes d’infrastructure qu’il sait supprimer pour résoudre exactement le même problème, pas au nombre de microservices Kubernetes qu’il sait empiler.