Ingénieur·e IA générative — RAG et évaluation

Construire la démarche d'évaluation d'un pipeline RAG en production — Golden Dataset, tests de régression en CI, monitoring des coûts et de la latence — au sein de l'IA Factory d'une organisation publique réglementée.

Description du client

Cabinet de conseil et de formation en IA et data fondé en 2019, en croissance, qui accompagne des grands comptes de la banque, de l'assurance, du secteur public et de la défense dans leurs projets d'intelligence artificielle. La mission s'inscrit dans sa Gen AI Factory, aux côtés d'un Lead Tech et d'une ingénieure interne.

Deux plateformes de RAG sont déjà en production pour un acteur du secteur public, dans un environnement réglementé et soumis à une contrainte de souveraineté numérique (modèles open-weight uniquement). La pertinence des réponses plafonne aujourd'hui autour de 50 % : il faut industrialiser l'évaluation et le monitoring avant l'ouverture à 10 %, puis 100 %, des utilisateurs.

Détail & objectif de la mission

Renforcer une IA Factory pour industrialiser l'évaluation d'un pipeline RAG servant deux plateformes déjà en production, dans un contexte secteur public réglementé, et accompagner leur montée en charge vers l'ensemble des utilisateurs.

  • Industrialiser l'évaluation du RAG : constitution du Golden Dataset, évaluation à froid et à chaud, suivi des métriques de pertinence.
  • Intégrer les tests de régression dans les pipelines CI pour sécuriser chaque évolution du pipeline de retrieval.
  • Améliorer en continu la chaîne RAG : stratégies de chunking, retriever sur PGVector, reranking, qualité de l'OCR en amont.
  • Outiller le monitoring des réponses, de la latence et des coûts d'inférence via Langfuse et LiteLLM.
  • Déployer les pilotes en production sur infrastructure OVH et absorber le passage à l'échelle par paliers d'utilisateurs.
  • Produire les livrables attendus par la DSI dans le respect des échéances fixées.
  • Dupliquer la démarche d'évaluation sur le second pilote une fois la méthodologie stabilisée.

Profil recherché

  • Expérience confirmée/senior en Python et développement d'API avec FastAPI, avec intégration dans un produit existant déjà déployé
  • Mise en production effective de systèmes RAG en entreprise : conception et amélioration du pipeline (chunking, retriever, reranking, OCR), évaluation à froid et à chaud, Golden Dataset, tests de régression, suivi de métriques de pertinence
  • Pratique des LLM open-weight et des frameworks d'orchestration et d'observabilité associés (LiteLLM, Langfuse ou équivalents), dans un contexte de souveraineté numérique excluant les SaaS américains
  • SQL et bases vectorielles, en particulier PGVector / PostgreSQL
  • Expérience de l'industrialisation et du passage à l'échelle : pipelines CI, monitoring, montée en charge progressive d'un service en production
  • Travail en méthodologie Agile dans un environnement grand compte ou secteur public, avec des échéances DSI à tenir ; lecture courante de documentation technique en anglais (le reste de la mission se déroule en français)

Un plus : orchestration de pipelines avec Airflow, pratique du cloud OVH, outillage MLOps (Docker, Kubernetes, MLflow), ML « classique » (scikit-learn, PyTorch, TensorFlow).

Complète tes informations en 3 min.
Tu seras recontacté en 24h.

2/10/26

Département : IA
Localisation : Télétravail
TJM : Selon profil
N° Mission : M-2026-016

Reçois les offres par email

Tu souhaites être notifié des dernières missions ?

Accès communauté

Description du client

Le client est un cabinet de conseil et de formation en intelligence artificielle et en data, fondé en 2019 et en croissance, qui intervient auprès de grands comptes de la banque, de l'assurance, du secteur public et de la défense. La mission se déroule au sein de sa Gen AI Factory, une équipe resserrée composée d'un Lead Tech et d'une ingénieure interne, que ce renfort vient compléter.

Le périmètre concerne deux plateformes de RAG (Retrieval Augmented Generation) déjà en production chez un acteur du secteur public, dans un environnement réglementé soumis à une contrainte de souveraineté numérique : seuls des modèles open-weight sont utilisés, à l'exclusion des services SaaS américains. La pertinence des réponses plafonne actuellement autour de 50 %, ce qui conditionne l'ouverture progressive du service à 10 % puis à 100 % des utilisateurs.

Objectifs de la mission

L'enjeu est de passer d'un pipeline RAG fonctionnel à un pipeline mesuré, surveillé et capable d'absorber une montée en charge par paliers. L'évaluation n'est pas un chantier ponctuel mais un outillage à construire, puis à transposer du premier pilote au second.

  • Construire le Golden Dataset et mettre en place l'évaluation à froid et à chaud des réponses, avec un suivi régulier des métriques de pertinence.
  • Intégrer des tests de régression dans les pipelines d'intégration continue afin que chaque évolution du retrieval soit vérifiée avant mise en production.
  • Travailler les leviers de qualité de la chaîne RAG : stratégies de chunking, retriever sur PGVector, reranking, et qualité de l'OCR en amont de l'indexation.
  • Outiller le monitoring des réponses, de la latence et des coûts d'inférence avec Langfuse et LiteLLM.
  • Déployer les pilotes en production sur infrastructure OVH et accompagner l'ouverture progressive aux utilisateurs.
  • Produire les livrables attendus par la DSI du client final dans les échéances fixées.
  • Répliquer la méthodologie d'évaluation sur le second pilote une fois celle-ci stabilisée sur le premier.

Profil recherché

Le profil attendu est un·e ingénieur·e IA générative confirmé·e ou senior, qui a déjà mis un système RAG en production en entreprise et sait en mesurer la qualité autrement qu'à l'œil. La capacité à industrialiser compte autant que la maîtrise du modèle.

  • Python et développement d'API avec FastAPI, avec une intégration effective dans un produit déjà déployé.
  • Conception et amélioration de pipelines RAG : chunking, retriever, reranking, OCR, évaluation à froid et à chaud, Golden Dataset, tests de régression, métriques de pertinence.
  • Pratique des LLM open-weight et des frameworks d'orchestration et d'observabilité associés, LiteLLM et Langfuse ou équivalents, dans un cadre de souveraineté numérique.
  • SQL et bases vectorielles, en particulier PGVector sur PostgreSQL.
  • Industrialisation et passage à l'échelle : pipelines CI, monitoring, montée en charge progressive d'un service en production.
  • Travail en Agile dans un environnement grand compte ou secteur public, avec des échéances DSI à tenir, et lecture courante de documentation technique en anglais.
  • Appréciés : Airflow, cloud OVH, outillage MLOps (Docker, Kubernetes, MLflow), machine learning classique (scikit-learn, PyTorch, TensorFlow).

FAQ

La mission est-elle ouverte au télétravail complet ?

La mission d'ingénieur·e IA générative s'effectue en télétravail, avec un fonctionnement hybride qui suppose une disponibilité pour des temps de présence. Le rythme exact de présence est précisé lors des échanges avec Koïno.

Quel est le rythme attendu et quand la mission démarre-t-elle ?

La mission est à temps plein et le démarrage est souhaité dès que possible.

Pourquoi la mission impose-t-elle des modèles open-weight uniquement ?

Les plateformes concernées servent un acteur du secteur public dans un environnement réglementé, soumis à une contrainte de souveraineté numérique. Cette contrainte exclut le recours aux services d'inférence SaaS américains et impose de travailler avec des LLM open-weight déployés sur une infrastructure maîtrisée, ici OVH.

Faut-il avoir déjà mis un RAG en production, ou une expérience de prototypage suffit-elle ?

Une mise en production effective d'un système RAG en entreprise est attendue : les plateformes sont déjà déployées et le travail porte sur l'évaluation, les tests de régression et la montée en charge d'un service existant, pas sur la construction d'une preuve de concept.

Quelle est la stack technique de la mission ?

La stack repose sur Python et FastAPI pour le développement, PGVector sur PostgreSQL pour la recherche vectorielle, LiteLLM et Langfuse pour l'orchestration des modèles et l'observabilité, des pipelines CI pour les tests de régression, et une infrastructure OVH pour le déploiement en production.

La mission se déroule-t-elle en français ou en anglais ?

La mission se déroule en français ; l'anglais est nécessaire pour la lecture courante de la documentation technique.

Mots-clés associés

mission freelance ingénieur IA générative, consultant RAG freelance, freelance LLM open-weight souveraineté numérique, mission freelance Python FastAPI IA, évaluation pipeline RAG Golden Dataset, freelance PGVector PostgreSQL base vectorielle, consultant Langfuse LiteLLM observabilité LLM, mission IA générative secteur public, freelance MLOps mise en production LLM, mission freelance IA en télétravail, ingénieur IA générative senior freelance France