Intelligence artificielle J’ai changé mon chunking de 800 à 1200 tokens, mon hit@1 a fait +12 %, et j’ai cru pendant trente secondes que j’avais trouvé l’optimum. En réalité, mes questions sur le MSS60 étaient désormais évaluées contre l’index du MSS54 : le routing entre corpus était cassé depuis le départ, sans que rien dans les métriques ne le signale. Une métrique en hausse produite par un pipeline d’éval cassé ressemble exactement à une métrique en hausse produite par une vraie amélioration. Trois pièges silencieux (routing multi-corpus, absence d’historique versionné, hit@k et MRR sans juge LLM) font que la plupart des équipes RAG prennent leurs décisions sur des chiffres qui ne mesurent rien.
Intelligence artificielle Le 8 mai 2026, Thariq Shihipar, ingénieur sur l’équipe Claude Code chez Anthropic, a publié un manifeste qui circule depuis : abandonnez le markdown, passez au HTML pour vos specs, plans d’implémentation et rapports. Le texte est intelligent, bien écrit, et structurellement un acte de marketing stratégique qui se présente comme un retour d’expérience personnel. Sur un sous-périmètre étroit (éditeurs jetables, playgrounds interactifs, prototypes avec sliders), l’auteur a raison ; sur tout le reste, son enthousiasme uniforme dissimule six angles morts. Coût en tokens balayé d’un revers de main, retournement du HTML sémantique en HTML présentationnel, perte de reviewabilité, paradoxe de la maintenance qui capture l’utilisateur dans la boucle de production, lecture survolée plutôt qu’éprouvée, surface d’attaque par indirect prompt injection. Analyse d’un signal stratégique mal déguisé, et matrice de décision pragmatique pour distinguer où le HTML mérite d’être adopté et où le markdown reste, par construction, le bon format pivot.
Intelligence artificielle À chaque session, Claude Code rouvre votre codebase comme un visiteur qui n’y aurait jamais mis les pieds. Il déplie le README, lance ses grep, ouvre des fichiers entiers pour reconstruire une architecture qu’il avait reconstituée la veille. Understand-Anything, projet open source publié en mars 2026, propose une autre voie : indexer la codebase en knowledge graph local, versionné comme un lock-file, interrogé à la demande par l’agent au lieu d’être relu à chaque tour. Ce n’est pas une optimisation de tokens, c’est un déplacement architectural qui prolonge la thèse « le RAG est mort, vive l’Agent » jusque dans le code lui-même. Pipeline multi-agents, économie comparée, limites du projet à six mois d’existence : ce que cette rupture change pour Claude Code et pour votre workflow.
Infrastructure & Données Convertir un PDF technique en markdown RAG-ready ne se résume pas à passer LlamaParse dessus. Sur un chapitre de 51 pages du Funktionsrahmen MSS60, la documentation Siemens du calculateur moteur des BMW M3 E92 et M5 E60, j’ai découvert que le travail intéressant commence après le parsing automatique. Les décisions sémantiques qui conditionnent vraiment la qualité du retrieval, préserver la langue source plutôt que traduire, éclater les tableaux denses en sous-sections individuelles, doubler les diagrammes en prose française et pseudo-code, aucun parser ne les prendra à votre place. Ce travail LLM-assisté ne se fait qu’une fois par document, son coût marginal par requête est zéro, et son investissement initial s’amortit en heures-utilisateur dès la première semaine d’utilisation. Retour d’expérience sur deux soirées de conversion qui ont retourné ma compréhension de ce qui rentabilise vraiment un pipeline RAG.
Infrastructure & Données Pendant qu’on débat de GPT-5 contre Claude 4.5 et de fenêtres à un million de tokens, 90% des pipelines RAG en production avalent une bouillie de pixels mal extraits par PyPDF2, puis s’étonnent que le LLM hallucine. Le problème n’est pas dans le cerveau du modèle : il est dans l’œsophage. Le parsing visuel, LlamaParse, Reducto pour la finance, Docling open-source d’IBM pour la souveraineté, transforme les PDF en Markdown structuré où chaque tableau, titre et paragraphe conserve son sens. Couplé à voyage-context-3, jusqu’à +23% de précision de retrieval sur contrats longs, et à des namespaces Pinecone bien partitionnés, ce pipeline déplace la bataille de l’IA d’entreprise du modèle vers la raffinerie de la donnée. Le LLM est interchangeable. La donnée propre, non.
Intelligence artificielle Si vous utilisez un LLM avec vos propres documents (ou si vous envisagez de le faire) vous allez tomber sur le RAG, Retrieval-Augmented Generation. Le principe semble simple : donner vos fichiers au modèle pour qu’il réponde mieux. En réalité, c’est un pipeline de sept décisions techniques où chaque maillon détermine si votre IA répond avec vos données ou invente avec aplomb. Ce guide couvre la mécanique complète avec les benchmarks 2026, les outils concrets (NotebookLM, ChromaDB, LangChain) et les pièges que j’ai rencontrés en construisant mes propres pipelines. De la théorie au code Python fonctionnel en 30 lignes.