Infrastructure & Données

C’est ici que se règle ce qui décide vraiment de la qualité d’un système IA : le pipeline, le stockage, l’évaluation et la facture. Cette catégorie documente le travail invisible depuis les cas réels, un PDF technique de constructeur transformé en markdown exploitable, un chunking dont l’amélioration apparente venait d’un jeu de questions biaisé, 84 000 chunks tenant dans la RAM d’un portable alors qu’on vend aux PME une pile à quatre services, une recherche vectorielle et un BM25 écrits en SQL pur plutôt que confiés à un fournisseur qui facture la donnée. Vous y trouverez le parsing visuel et pourquoi la plupart des pipelines avalent une bouillie de pixels, les métriques d’évaluation qui mentent quand on ne les regarde pas de près, les boucles agentiques et la dépendance qu’on vend avec, le coût réel de l’IA locale, machine, watts et souveraineté comprises. Écrit avec les mesures, les chiffres et les erreurs assumées, pour ceux qui doivent faire tourner ces systèmes plutôt que les présenter.

Votre RAG vous ment : pourquoi vos métriques d’éval sont (probablement) fausses

Intelligence artificielle

J’ai changé mon chunking de 800 à 1200 tokens, mon hit@1 a fait +12 %, et j’ai cru pendant trente secondes que j’avais trouvé l’optimum. En réalité, mes questions sur le MSS60 étaient désormais évaluées contre l’index du MSS54 : le routing entre corpus était cassé depuis le départ, sans que rien dans les métriques ne le signale. Une métrique en hausse produite par un pipeline d’éval cassé ressemble exactement à une métrique en hausse produite par une vraie amélioration. Trois pièges silencieux (routing multi-corpus, absence d’historique versionné, hit@k et MRR sans juge LLM) font que la plupart des équipes RAG prennent leurs décisions sur des chiffres qui ne mesurent rien.

Le manifeste HTML d’Anthropic : une taxe sur l’intelligence déguisée en progrès

Intelligence artificielle

Le 8 mai 2026, Thariq Shihipar, ingénieur sur l’équipe Claude Code chez Anthropic, a publié un manifeste qui circule depuis : abandonnez le markdown, passez au HTML pour vos specs, plans d’implémentation et rapports. Le texte est intelligent, bien écrit, et structurellement un acte de marketing stratégique qui se présente comme un retour d’expérience personnel. Sur un sous-périmètre étroit (éditeurs jetables, playgrounds interactifs, prototypes avec sliders), l’auteur a raison ; sur tout le reste, son enthousiasme uniforme dissimule six angles morts. Coût en tokens balayé d’un revers de main, retournement du HTML sémantique en HTML présentationnel, perte de reviewabilité, paradoxe de la maintenance qui capture l’utilisateur dans la boucle de production, lecture survolée plutôt qu’éprouvée, surface d’attaque par indirect prompt injection. Analyse d’un signal stratégique mal déguisé, et matrice de décision pragmatique pour distinguer où le HTML mérite d’être adopté et où le markdown reste, par construction, le bon format pivot.

Claude Code est amnésique. Understand-Anything le soigne.

Intelligence artificielle

À chaque session, Claude Code rouvre votre codebase comme un visiteur qui n’y aurait jamais mis les pieds. Il déplie le README, lance ses grep, ouvre des fichiers entiers pour reconstruire une architecture qu’il avait reconstituée la veille. Understand-Anything, projet open source publié en mars 2026, propose une autre voie : indexer la codebase en knowledge graph local, versionné comme un lock-file, interrogé à la demande par l’agent au lieu d’être relu à chaque tour. Ce n’est pas une optimisation de tokens, c’est un déplacement architectural qui prolonge la thèse « le RAG est mort, vive l’Agent » jusque dans le code lui-même. Pipeline multi-agents, économie comparée, limites du projet à six mois d’existence : ce que cette rupture change pour Claude Code et pour votre workflow.

Transformer un PDF complexe en markdown vraiment RAG-ready

Infrastructure & Données

Convertir un PDF technique en markdown RAG-ready ne se résume pas à passer LlamaParse dessus. Sur un chapitre de 51 pages du Funktionsrahmen MSS60, la documentation Siemens du calculateur moteur des BMW M3 E92 et M5 E60, j’ai découvert que le travail intéressant commence après le parsing automatique. Les décisions sémantiques qui conditionnent vraiment la qualité du retrieval, préserver la langue source plutôt que traduire, éclater les tableaux denses en sous-sections individuelles, doubler les diagrammes en prose française et pseudo-code, aucun parser ne les prendra à votre place. Ce travail LLM-assisté ne se fait qu’une fois par document, son coût marginal par requête est zéro, et son investissement initial s’amortit en heures-utilisateur dès la première semaine d’utilisation. Retour d’expérience sur deux soirées de conversion qui ont retourné ma compréhension de ce qui rentabilise vraiment un pipeline RAG.

Le parsing visuel : pourquoi vos PDF sabotent votre RAG (et comment LlamaParse corrige le tir)

Infrastructure & Données

Pendant qu’on débat de GPT-5 contre Claude 4.5 et de fenêtres à un million de tokens, 90% des pipelines RAG en production avalent une bouillie de pixels mal extraits par PyPDF2, puis s’étonnent que le LLM hallucine. Le problème n’est pas dans le cerveau du modèle : il est dans l’œsophage. Le parsing visuel, LlamaParse, Reducto pour la finance, Docling open-source d’IBM pour la souveraineté, transforme les PDF en Markdown structuré où chaque tableau, titre et paragraphe conserve son sens. Couplé à voyage-context-3, jusqu’à +23% de précision de retrieval sur contrats longs, et à des namespaces Pinecone bien partitionnés, ce pipeline déplace la bataille de l’IA d’entreprise du modèle vers la raffinerie de la donnée. Le LLM est interchangeable. La donnée propre, non.

Le RAG expliqué comme personne ne le fait : du concept au pipeline qui fonctionne

Intelligence artificielle

Si vous utilisez un LLM avec vos propres documents (ou si vous envisagez de le faire) vous allez tomber sur le RAG, Retrieval-Augmented Generation. Le principe semble simple : donner vos fichiers au modèle pour qu’il réponde mieux. En réalité, c’est un pipeline de sept décisions techniques où chaque maillon détermine si votre IA répond avec vos données ou invente avec aplomb. Ce guide couvre la mécanique complète avec les benchmarks 2026, les outils concrets (NotebookLM, ChromaDB, LangChain) et les pièges que j’ai rencontrés en construisant mes propres pipelines. De la théorie au code Python fonctionnel en 30 lignes.