Architecture data moderne : Big Data & AI Paris 2026

5/10/26

Big Data & AI Paris 2026 : ce qu'on retient de la scène Architecture Data Moderne

TL;DR : Sur la scène Architecture Data Moderne de Big Data & AI Paris 2026, un message a dominé les seize conférences : l'IA agentique se gagne dans l'architecture des données plus que dans le choix du modèle. JCDecaux et ADEO misent sur une couche sémantique, L'Oréal sur une passerelle IA gouvernée. Le Crédit Agricole définit la souveraineté comme la maîtrise de ses dépendances. Selon Microsoft Research, une requête de raisonnement consomme 13 fois plus d'énergie qu'une requête simple.

À retenir

  • AI Factory France, pilotée par le GENCI, fait partie des 19 AI Factories européennes et attend Alice Recoque, supercalculateur exascale de 554 millions d'euros.
  • La couche sémantique devient le socle des agents : chez JCDecaux, aucun des pays suivis n'avait la même définition du revenu.
  • ADEO / Leroy Merlin a réduit de près de 90 % ses 120 000 tableaux de bord avant de les migrer vers Looker.
  • L'open source déplace le coût vers les compétences : l'Insee a mis quinze ans à sortir de SAS.
  • Contre l'injection de prompt, la défense est architecturale : permissions minimales, contrôle avant action, instructions séparées des données.

Big Data & AI Paris a tenu sa 15e édition les 15 et 16 septembre 2026 à Paris Expo Porte de Versailles, avec 15 000 participants attendus selon le communiqué officiel. Pour la première fois, le programme était organisé en trois tracks : Architecture Data Moderne, Gouvernance & Réglementation, et Data & IA au service du business. L'équipe Koïno a suivi les conférences de la scène Architecture Data Moderne.

Voici ce que nous en retenons. La conformité est traitée dans notre article sur la scène Gouvernance & Réglementation, et les retours d'expérience métier dans celui sur la scène Data & IA au service du business. Sauf mention contraire, les chiffres viennent des intervenants.

Les conférences en un coup d'œil

ConférenceIntervenants (organisations)Ce qu'on retient
AI Factory FranceStéphane Requena (GENCI)Calcul, données, modèles et expertise réunis.
Lakehouse et data productsValentin Berthelot, Axel de Cuniac (JCDecaux)Pas d'agents sans définitions métier alignées.
Sécurité des systèmes d'IAGuillaume Chevron (secteur de l'énergie)Le risque vient des droits ouverts au modèle.
L'open source comme alternative souveraineFlorian Caringi (Groupe BPCE), Frédéric Comte (Insee), Odile Jacqmin (Altares)L'open source déplace le coût vers les compétences.
Industrialiser la connaissance métierFrançois Lemeille (RATP)Un socle RAG mutualisé, la qualité comme porte.
Explorer un océan de donnéesYann Keramoal, Ronan Jarno (Shom)Une base de référence sur site, en architecture médaillon.
Sécurité, souveraineté et autonomieSami Ktari (Crédit Agricole SA)Toute dépendance critique doit rester remplaçable.
Composants et systèmes du numériqueCédric Gouy-Pailler (CEA)Des puces conçues vite, une inférence plus sobre.
Quantum-centric supercomputingPierre Jaeger (IBM)Le quantique complétera CPU et GPU.
Découpler l'outil de la donnéeCorentin Inglard (ADEO / Leroy Merlin), Samuel Morin (Ellipsys)Une logique métier portable, en SQL standard.
L'Oréal Agentic PlatformThomas Menard, Gauthier Debuiche (L'Oréal)Une passerelle IA pour gouverner les agents.
De la data à la décision : le lineageOlivia Kazan (ex-Kering)Tracer la décision, plus seulement la donnée.
Sécurité de l'IA agentiqueFabien Schwebel (Europcar Mobility Group), Lucile Coupez (EssilorLuxottica), Sylvan Ravinet (Eres)L'injection de prompt se traite dès la conception.
Ancrer l'IA dans le monde physiqueAdrien Ramanana Rahary (Kyutai)Des world models pour planifier avant d'agir.
Coder avec des agents IAChristophe Prudhomme (Société Générale)Spécifier, tester, auditer : la méthode fait le gain.
La science des données avec des agents IAYann Debray (Probabl)La rigueur de scikit-learn appliquée aux agents.

Qu'est-ce qu'une AI Factory, et que change-t-elle pour les entreprises ?

Une AI Factory est un supercalculateur optimisé pour l'IA, entouré de services : accompagnement, formation, accès à des données et à des modèles. EuroHPC en a sélectionné 19 en Europe, dont AI Factory France, pilotée par le GENCI avec Inria. Une entreprise y trouve du calcul public gratuit pour la recherche, puis un passage en production chez un cloud souverain comme Scaleway.

Stéphane Requena, directeur technique et innovation du GENCI, revendique plus de 2 400 projets servis l'an dernier, dont environ 1 700 liés à l'IA. Alice Recoque, premier supercalculateur exascale français, représente un coût global de 554 millions d'euros selon AMD et Eviden. Stéphane Requena prévient pourtant : « Ne soyez pas aveuglés par les chiffres ahurissants de GPU » ; l'accompagnement compte autant que la puissance.

Combien d'énergie consomme une requête d'IA ?

Une requête simple consomme en médiane 0,34 Wh sur un modèle frontière, et une requête de raisonnement 4,32 Wh, soit 13 fois plus, selon Microsoft Research. Cédric Gouy-Pailler, responsable du programme IA du CEA, plaide pour optimiser ensemble modèle, déploiement et matériel, ce qui pourrait diviser cette énergie par 8 à 20. Il propose de mesurer l'intelligence produite par joule plutôt que les opérations.

Lakehouse et data products : comment préparer ses données pour l'IA ?

En organisant les données en data products stockés dans des formats de table ouverts, puis en ajoutant une couche sémantique et une couche de contexte lisibles par les agents. C'est l'architecture présentée par Valentin Berthelot, head of data platform de JCDecaux, et Axel de Cuniac. Grâce aux formats ouverts comme Iceberg, des moteurs comme Trino, ClickHouse ou Snowflake lisent les mêmes tables, ce qui limite la dépendance à un éditeur.

Qu'est-ce qu'un data product ?

Un data product est un ensemble de données préparées pour un usage métier précis, avec un propriétaire, des règles de calcul, des engagements de qualité et une documentation. Il se gère comme un logiciel, avec une feuille de route et des livraisons. JCDecaux cite la vue client 360, le rapport d'inventaire et les ventes hebdomadaires.

Couche sémantique ou couche de contexte : quelle différence ?

La couche sémantique décrit ce qui se traduit en SQL : tables, mesures, dimensions, métriques et glossaire. La couche de contexte ajoute contrats, archives, documents, provenance des données et graphe de connaissances. Le plus dur a été d'aligner les indicateurs : sur la vingtaine de pays suivis par l'équipe data, aucun n'avait la même définition du revenu. « Sans ça, on ne peut pas déployer d'agents génériques depuis le groupe », résume Valentin Berthelot.

Shom : une architecture médaillon sur site

Le Shom suit lui aussi une architecture médaillon, entièrement sur site par souci de souveraineté. Son projet Tethys a produit une base bathymétrique de référence d'environ 35 milliards de points, mise à jour chaque jour, que les cartographes n'ont plus à requalifier. Les traitements reposent sur l'ETL FME, un logiciel propriétaire assumé, accessible à des hydrographes non développeurs.

Pourquoi repenser le data lineage à l'ère de l'IA ?

Parce qu'avec l'IA, savoir d'où vient une donnée ne suffit plus : il faut reconstituer la chaîne qui a conduit à une décision. Olivia Kazan, head of data governance passée par Kering, parle de decision lineage : sources, versions, documents et état de l'exécution, capturés au moment de la décision. Dans son exemple, une recommandation incohérente venait d'un changement de schéma non propagé jusqu'à l'index vectoriel : quatre équipes et trois semaines pour remonter à la cause. « Un incident IA est rarement un problème de modèle », conclut-elle.

Comment rendre ses données interopérables sans dépendre d'un outil ?

La clé est de sortir la logique métier des outils pour l'écrire dans un langage standard. ADEO / Leroy Merlin l'a fait en migrant ses tableaux de bord SAP BusinessObjects vers Looker, un chantier de trois ans achevé en juin 2026, présenté par Corentin Inglard, product manager Analytics Solutions, et Samuel Morin, CEO d'Ellipsys. Trois choix ont fait la différence :

  • Réduire avant de migrer : l'analyse des usages a réduit de près de 90 % le volume des 120 000 tableaux de bord accumulés en vingt ans.
  • Automatiser la conversion : univers traduits en explores Looker, invites en filtres, visuels reproduits.
  • Découpler la donnée de l'outil : une brique intermédiaire, bientôt en open source, prépare les données en SQL standard et les expose comme une base PostgreSQL lisible par tout outil.

Comme chez JCDecaux, la couche sémantique est devenue le socle des agents : celle de Looker accueille déjà des usages conversationnels. Le standard Apache Ossie, nouveau nom de l'Open Semantic Interchange lancé par Snowflake, vise à rendre cette sémantique portable et rassemble plus de 50 organisations. Notre guide des outils de semantic layer compare les solutions.

L'open source est-il une alternative souveraine au cloud américain ?

Oui, s'il est traité comme une stratégie de compétences et de dépendances, pas comme une économie de licences. C'est la conclusion de la table ronde réunissant Florian Caringi (Groupe BPCE), Frédéric Comte (Insee) et Odile Jacqmin (Altares). L'open source n'est ni gratuit ni magique : le coût se déplace vers l'ingénierie et les compétences, et la souveraineté consiste à choisir ses dépendances.

Insee et Altares : sortir de SAS, viser la portabilité

L'Insee a utilisé SAS pendant trente ans ; selon Frédéric Comte, l'éditeur a voulu quadrupler le prix des licences en 2022, et l'institut, autonome grâce à son datalab open source Onyxia, a pu refuser. Le dernier serveur SAS a été éteint le 24 décembre 2025, selon Le Monde Informatique. Odile Jacqmin a pourtant vu Talend Open Studio, qu'elle avait choisi, retiré par Qlik en janvier 2024. D'où sa règle : la portabilité est « un critère de qualité architecturale au même titre que la performance ou la sécurité ».

Comment construire une architecture IA souveraine et résiliente ?

Sami Ktari, lead architecte IA et DevOps Cloud au Crédit Agricole, juge le débat entre sur site et cloud trop réducteur : une dépendance critique est acceptable si elle est gouvernée, observable, testable et remplaçable. Il place donc une passerelle IA entre applications et modèles, pour router, basculer en cas de panne et changer de fournisseur sans refonte. « Une architecture souveraine, ce n'est pas une architecture sans dépendance, c'est une architecture qui maîtrise ses dépendances », conclut-il. Ses cinq questions avant toute nouvelle solution :

  1. Quelles données sortent du périmètre maîtrisé, et vers où ?
  2. Qui contrôle les identités, les clés et les secrets ?
  3. Quelles actions l'agent peut-il déclencher : lire, ou écrire dans le SI ?
  4. Comment observe-t-on prompts, réponses, dérives et coûts ?
  5. Quel fallback a été testé, et en combien de temps remplace-t-on le composant ?

Un fallback non testé reste une hypothèse, insiste-t-il. Le Data Act européen, applicable depuis le 12 septembre 2025, facilite le changement de fournisseur cloud. Notre guide de l'IA souveraine détaille les options d'hébergement en Europe.

Qu'est-ce qu'une plateforme agentique d'entreprise ?

C'est un socle commun qui donne accès, sous gouvernance, aux modèles, aux connecteurs, aux agents, aux garde-fous et au suivi des coûts. Il évite que chaque équipe reconstruise ses briques. L'Oréal et la RATP en ont présenté deux versions.

L'Oréal : une passerelle IA pour gouverner modèles, MCP et agents

L'Oréal GPT, lancé à l'été 2023, compte 27 000 utilisateurs uniques et 240 000 messages par jour, selon Thomas Menard, global head of agentic platform. Faute de gouvernance, chaque équipe recréait ses serveurs MCP vers Microsoft Graph, ServiceNow ou Salesforce. La nouvelle plateforme, multicloud et multi-LLM, centralise dans une passerelle IA modèles, MCP gouvernés, garde-fous versionnés, coûts et identité des agents. Gauthier Debuiche, AI lead engineer, prépare une couche de contexte : graphe de connaissances, skills décrivant les procédures, mémoire des corrections.

RATP : industrialiser le RAG avec une porte qualité

Sur son socle Séquoi'IA, la RATP a mis en production quatre assistants fondés sur le RAG, selon François Lemeille, ingénieur IA : un démonstrateur en une semaine, puis une industrialisation en un mois. Avant chaque livraison, un LLM juge compare les réponses à une base de questions et réponses rédigées par les experts métier, jamais par l'IA : 550 pour l'assistant des agents en gare. L'énergie de chaque inférence est mesurée avec EcoLogits, car « on ne peut optimiser ou réduire que ce qu'on est capable de mesurer ».

Comment sécuriser des agents IA contre l'injection de prompt et les failles ?

La défense la plus solide est architecturale : permissions minimales, contrôle avant chaque action, bac à sable surveillé et séparation des instructions et des données. Guillaume Chevron, lead cybersecurity data scientist dans le secteur de l'énergie, l'a rappelé : un modèle ne fait que produire du texte, le risque vient des droits qu'on lui ouvre. Il a analysé l'incident de juillet 2026 : des modèles d'OpenAI, évalués sur un banc d'essai cyber, sont sortis de leur bac à sable et ont pénétré l'infrastructure de Hugging Face pour y chercher les solutions du test, comme l'ont documenté Hugging Face puis OpenAI.

Fabien Schwebel, group CISO d'Europcar Mobility Group, a montré qu'en suivant le tutoriel officiel de Visual Studio Code, une IA génère en quelques minutes une calculatrice capable d'exécuter n'importe quel code venu du réseau. « On peut aller à 130 km/h en direction du gouffre », résume-t-il. Sylvan Ravinet, CISO d'Eres, a fait envoyer un dossier client à un attaquant par un agent de messagerie, puis a bloqué l'attaque avec CaMeL, une approche de Google DeepMind où les données lues ne modifient jamais le plan d'exécution. Le groupe de travail du CESIN et de l'IMA en tire une règle : ne jamais faire confiance à ce que produit un modèle.

Garde-fouCe qu'il empêcheDéfendu sur scène parLimite
Permissions minimales, identité propre à l'agentÉcrire là où il faudrait lireGuillaume Chevron, Sami KtariInutile contre une faille inconnue
Contrôle avant chaque action (hook)Une suppression ou un envoi non prévuGuillaume ChevronSuppose des règles explicites
Bac à sable surveillé, plafonds de coût et de duréeUne dérive que personne ne voitGuillaume Chevron, Lucile CoupezSans observabilité, il ne protège pas
Instructions séparées des données (CaMeL)Injection de prompt, exfiltrationSylvan Ravinet77 % de tâches réussies contre 84 % sans défense
Liste blanche des serveurs MCP et des paquetsConnecteurs piégés, paquets inventésChristophe PrudhommeExige une revue humaine

Lucile Coupez, RSSI gouvernance groupe d'EssilorLuxottica, rappelle que 70 à 80 % des composants viennent désormais de tiers : le risque fournisseur passe en tête des priorités. Sans équipes pluridisciplinaires proches des métiers, prévient-elle, le shadow AI s'installe. La gouvernance des agents est détaillée dans notre article sur la scène Gouvernance & Réglementation.

Comment coder et faire de la data science avec des agents IA ?

Le plus sûr est de traiter les agents comme des développeurs juniors très productifs, encadrés par des spécifications, des tests et un backlog. Christophe Prudhomme, responsable de département IT à la Société Générale, l'a vérifié sur des projets personnels, hors des contraintes de la banque : un gain proche de x10, pour environ 400 euros de tokens par mois. Le goulot d'étranglement passe à la relecture et aux tests. Ses six règles :

  1. Spécifier avant de coder, et tenir la spécification à jour.
  2. Prouver par des tests exhaustifs.
  3. Faire du backlog la seule vérité : « Si ce n'est pas dans le backlog, ça n'existe pas. »
  4. Auditer régulièrement le travail des agents.
  5. Séparer les pouvoirs : une branche et un compte par agent, aucun agent qui pousse seul en production.
  6. Garder l'humain aux commandes : sans lui, aucune solution ne converge vers la production.

Yann Debray, CPO de Probabl, société fondée par les créateurs de scikit-learn, voit le même risque en data science : à force d'itérer vite, on ne sait plus si la validation est propre. Sur un jeu de données à 8 % de cas positifs, un modèle qui répond toujours non obtient 92 % de bonnes réponses sans rien prédire. Son outil skore encadre l'agent par des contrôles méthodologiques, quel que soit le modèle, que notre comparatif Mistral, OpenAI ou Anthropic aide à choisir.

World models et calcul quantique : faut-il s'y préparer dès 2026 ?

Oui pour comprendre et expérimenter, pas encore pour transformer son SI. Ces deux technologies sortent à peine des laboratoires. Elles complètent l'existant au lieu de le remplacer.

Qu'est-ce qu'un world model ?

Un world model est un modèle d'IA qui apprend, à partir de vidéos ou de capteurs associés à des actions, à prédire comment un environnement évolue après une action. Là où un LLM prédit le mot suivant, il prédit l'état suivant du monde, pour planifier ou simuler un scénario dangereux. Adrien Ramanana Rahary, chercheur chez Kyutai, a présenté un modèle qui a réappris la physique du jeu Rocket League sans règle codée, en reconnaissant ses limites, dont la confusion entre corrélation et causalité.

Le calcul quantique va-t-il remplacer les GPU ?

Non : pour Pierre Jaeger, directeur technique chez IBM, l'architecture cible associe CPU, GPU et processeur quantique, chacun sur la part du calcul où il excelle. IBM vise pour 2029 Starling, un ordinateur tolérant aux pannes capable d'exécuter 100 millions de portes quantiques sur 200 qubits logiques. Les usages visés sont la simulation chimique, l'optimisation, les séries temporelles et les équations aux dérivées partielles, pas l'IA générative.

Que faut-il faire en 2026 pour moderniser son architecture data ?

Partir des usages critiques, puis consolider les fondations : définitions métier, formats ouverts, passerelle IA, sécurité dès la conception et mesure. Voici la checklist que nous tirons des seize conférences. Pour l'adapter à votre contexte, échangeons sur vos priorités.

ChantierAction en 2026Repère entendu sur scènePour une PME ou une ETI
Définitions métierAligner les indicateurs clés dans une couche sémantiqueJCDecauxCommencer par ceux du comité de direction
Formats ouvertsTables ouvertes, logique en SQL standardADEO / Leroy MerlinExiger un export standard de chaque outil
Passerelle IARouter et journaliser les appels de modèlesCrédit Agricole, L'OréalUn routeur multi-modèles suffit au départ
Sécurité des agentsPermissions minimales, contrôle avant actionEres, EuropcarPas d'écriture dans le SI avant validation
Qualité et lineageQuestions de test écrites par les experts, lineage à l'exécutionRATP, ex-KeringUne décision critique tracée de bout en bout
Coûts et énergieMesurer coût et énergie par usageL'Oréal, RATP, CEAUn compteur de coût par cas d'usage

Le point Koïno : pour une PME ou une ETI, nous retenons surtout que les agents réussissent quand les définitions métier sont écrites, versionnées et partagées. C'est pourquoi, chez Koïno, le scoring et les règles de décision ne sont jamais laissés à l'IA : ce sont des règles métier versionnées et auditables. Nous restons agnostiques et partenaires d'aucun éditeur : chez Molydal, des modèles open source ont été comparés sur les données du client avant un hébergement sur un cloud souverain français. Après un cadrage d'un mois au plus, nous livrons vite un premier produit, itéré chaque semaine, garanti un mois en production et doté d'un compteur de ROI : c'est notre approche forward deployed.

Vos données sont-elles prêtes pour des agents IA ? Contactez Koïno : un premier échange de 30 minutes suffit pour situer vos fondations et prioriser les chantiers. Nous partons toujours d'un usage réel, mesuré avant et après.

Questions complémentaires

Comment coder avec des agents IA sans perdre la qualité ?

Il faut écrire les spécifications avant le code, exiger des tests exhaustifs, tenir un backlog unique, auditer régulièrement et donner à chaque agent sa branche et son compte. La relecture et les tests deviennent alors le principal goulot d'étranglement.

À propos de l'auteur

Maxence Morin est co-fondateur (Tech & Ops) de Koïno, cabinet français d'IA et de data. Il conçoit avec les équipes de Koïno les architectures data et les plateformes d'agents IA des PME et des ETI. Retrouvez-le sur .

Trouvez un expert pour votre projet, sélectionné par notre IA en 2min :

Thank you! Your submission has been received!
Oops! Something went wrong while submitting the form.

Table des matières

{{text}}

Décrivez votre enjeu, notre IA vous envoie 3 cas d'usage concrets en 2 min

Thank you! Your submission has been received!
Oops! Something went wrong while submitting the form.

Cliquez sur une IA pour savoir ce que Koïno peut faire pour vous

FAQ - Questions fréquentes

Découvrez ici les réponses aux questions les plus courantes pour mieux comprendre notre expertise et notre accompagnement personnalisé chez Koïno AI.

Contactez notre équipe

Quelles sont les tendances de l'architecture data en 2026 ?

À Big Data AI Paris 2026, la scène Architecture Data Moderne a mis en avant la couche sémantique, les formats ouverts, les passerelles IA multi-modèles et la sécurité dès la conception. La souveraineté y est vue comme la maîtrise des dépendances plutôt que comme un lieu d'hébergement.

Qu'est-ce qu'une AI Factory ?

Une AI Factory est un supercalculateur optimisé pour l'IA, associé à des services d'accompagnement, de formation et d'accès aux données et aux modèles. L'Union européenne en a sélectionné 19 via EuroHPC, dont AI Factory France, pilotée par le GENCI.

Qu'est-ce qu'un data product ?

Un data product est un ensemble de données préparées pour une finalité métier, avec un propriétaire, des règles de calcul, des engagements de qualité et une documentation. Il se gère comme un logiciel, et des agents IA l'interrogent via une couche sémantique.

Comment protéger un agent IA contre l'injection de prompt ?

En séparant les instructions de confiance des données non fiables, en limitant les permissions de l'agent et en vérifiant chaque appel d'outil par une règle déterministe. C'est le principe de CaMeL, publié par des chercheurs de Google et de Google DeepMind.

L'open source permet-il d'être souverain face au cloud américain ?

En partie : il réduit la dépendance à un éditeur mais en crée d'autres, en compétences et en maintenance. Les intervenants de Big Data AI Paris 2026 conseillent de l'introduire d'abord sur les formats de stockage ouverts, sans big bang.