IESEG

Mission : L'IESEG a fait passer la part de profils à jour de sa base de plus de 20 000 alumni de 62 % à 95 %, un niveau validé par un audit interne, grâce à un pipeline data outillé par des LLM. GPT-4 classe les changements de poste détectés sur LinkedIn, Sentence-BERT déduplique par embeddings et des webhooks n8n propagent chaque mise à jour en 45 secondes au lieu de 20 minutes. Le taux de doublons chute de 18 % à 0,8 % et 36 heures de maintenance sont économisées chaque mois par les équipes relations alumni et carrières.
Secteur : Technologie
Date : Feb 04, 2025

Problème

62 % de profils à jour seulement, 18 % de doublons et 40 heures de maintenance par mois

Les données alumni étaient dispersées entre plusieurs bases, sans vision unique : 18 % de doublons, des champs obsolètes et seulement 62 % de profils à jour. Chaque mise à jour manuelle prenait 20 minutes, la maintenance mobilisait 40 heures par mois et un signal carrière mettait 2 semaines à atteindre les services concernés. Impossible, à ce rythme, de détecter les changements de poste ni de mesurer le ROI des actions réseau.

Solution

Un pipeline Airbyte, BigQuery et dbt, avec GPT-4, Sentence-BERT et n8n en continu

Un socle data unifié (Airbyte pour l'extraction, BigQuery en entrepôt, dbt pour la modélisation, sur Google Cloud) alimente le référentiel. Un crawler propriétaire et l'API Sales Navigator collectent les signaux LinkedIn ; GPT-4 classe les changements de poste et des webhooks n8n propagent la mise à jour en moins de 15 minutes. Sentence-BERT déduplique par embeddings, Vertex AI enrichit les profils et Great Expectations valide la qualité avant chaque chargement.

Résultats

Des profils à jour de 62 % à 95 % et une mise à jour en 45 secondes au lieu de 20 minutes

La part de profils à jour grimpe de 62 % à 95 %, validée par un audit interne, et le taux de doublons chute de 18 % à 0,8 %. Les mises à jour passent de 20 minutes à 45 secondes, soit 36 heures de maintenance économisées par mois, et les signaux carrière atteignent les équipes en 15 minutes au lieu de 2 semaines. Trois services internes exploitent les alertes, pour un retour sur investissement multiplié par 4,2 sur un an.

95 % à jour

La part de profils alumni à jour passe de 62 % à 95 %, un niveau validé par un audit interne de l'école.

45 secondes

Chaque mise à jour de profil demandait 20 minutes de traitement manuel ; elle se propage désormais en 45 secondes via les webhooks n8n, soit 36 heures économisées par mois.

0,8 % de doublons

Le taux de doublons de la base chute de 18 % à 0,8 % grâce à la déduplication par embeddings Sentence-BERT (seuil de similarité 0,92).

Trouvez un expert pour votre projet, sélectionné par notre IA en 2min :

Thank you! Your submission has been received!
Oops! Something went wrong while submitting the form.

Le contexte : 20 000 parcours d'anciens élèves à suivre en permanence

L'IESEG, grande école de commerce française, anime une communauté de plus de 20 000 anciens élèves. Leurs parcours évoluent en permanence : changements de poste, d'entreprise, de secteur ou de pays. Pour les services relations alumni et carrières, la valeur du réseau dépend directement de la fraîcheur de ces informations : un profil obsolète, c'est une invitation mal ciblée, une opportunité de partenariat manquée, un signal carrière jamais exploité.

Les données alumni étaient pourtant dispersées entre plusieurs bases internes, souvent redondantes, sans vision unique. Le projet visait un objectif précis : construire un référentiel unique, fiable et partagé, mis à jour en temps quasi réel grâce à un pipeline de données outillé par des LLM.

Résultat le plus marquant : la part de profils à jour est passée de 62 % à 95 %, un niveau validé par un audit interne, pendant que le taux de doublons chutait de 18 % à 0,8 %.

Le problème : 62 % de profils à jour seulement, 18 % de doublons et 40 heures de maintenance par mois

Les fichiers existants étaient incomplets, contenaient des doublons et ne reflétaient pas les trajectoires professionnelles les plus récentes. Chaque consolidation passait par des opérations manuelles qui mobilisaient des ressources élevées et retardaient l'exploitation des signaux carrière. Le coût de l'inaction se mesurait sur trois plans :

  • Une base fiable à 62 % seulement : 18 % de doublons, des champs obsolètes et des données éparpillées entre plusieurs bases, sans vision unique de chaque ancien élève.
  • 20 minutes par mise à jour manuelle et 40 heures de maintenance chaque mois : impossible de suivre 20 000 parcours à ce rythme, ni de détecter automatiquement les changements de poste.
  • 2 semaines de délai pour qu'un signal carrière atteigne les services concernés : des décisions retardées pour les équipes relations alumni et carrières, et un ROI des actions réseau impossible à mesurer.

La solution : un pipeline data où GPT-4 classe les changements de poste et n8n propage la mise à jour

Le dispositif combine un pipeline de données cloud, des outils NoCode et des modules d'IA pour fiabiliser et enrichir les profils alumni en continu, sans interruption de service. Il s'est construit en quatre briques :

  1. Un socle data unifié. Airbyte extrait les données des différentes sources, BigQuery sert d'entrepôt central et dbt modélise les jeux de données, le tout orchestré sur Google Cloud. Chaque transformation est versionnée et traçable.
  2. La collecte LinkedIn et la détection des changements de poste. Un crawler propriétaire et l'API Sales Navigator alimentent le pipeline en signaux carrière. GPT-4 classe chaque changement détecté, puis des webhooks n8n déclenchent la mise à jour du profil concerné en moins de 15 minutes.
  3. Le nettoyage et la déduplication. Un modèle d'embeddings Sentence-BERT compare les profils entre eux : au-delà de 0,92 de similarité, les doublons sont fusionnés automatiquement. Les embeddings sont recalculés tous les six mois pour maintenir la pertinence de la déduplication.
  4. L'enrichissement, la qualité et la diffusion. Vertex AI enrichit sémantiquement chaque profil (compétences, secteurs) et les règles de qualité Great Expectations valident les données avant chaque chargement. Côté usage, une read-replica PostgreSQL expose le référentiel via une API GraphQL Hasura, un dashboard Retool sert les équipes carrières et des alertes Slack signalent les changements de poste clés.

L'architecture : de l'extraction à l'alerte Slack

  • Airbyte, BigQuery, dbt sur Google Cloud : extraction, entrepôt et modélisation des données.
  • Crawler propriétaire et API Sales Navigator : collecte des signaux carrière LinkedIn.
  • GPT-4 pour la classification des changements de poste, webhooks n8n pour une mise à jour en moins de 15 minutes.
  • Sentence-BERT pour la déduplication par embeddings (seuil de similarité 0,92), Vertex AI pour l'enrichissement sémantique, Great Expectations pour les règles de qualité avant chargement.
  • PostgreSQL, Hasura GraphQL, Retool et Slack : diffusion temps réel, dashboard des équipes carrières et alerting.

Contraintes respectées : RGPD, qualité contrôlée et traçabilité

Une base de 20 000 profils nominatifs impose un cadre strict. Le référentiel a été construit autour de quatre garanties :

  • Alignement RGPD : le référentiel est aligné sur les standards RGPD, et un audit dédié est planifié pour compléter la documentation technique.
  • Qualité contrôlée avant chargement : les règles Great Expectations valident chaque lot de données avant son entrée dans le référentiel ; leur passage en mode bloquant est inscrit à la feuille de route.
  • Traçabilité complète : le pipeline est versionné et chaque transformation de donnée est tracée, donc auditable.
  • Pertinence maintenue dans le temps : les embeddings de déduplication sont mis à jour tous les six mois et les corrections de qualité sont automatisées plutôt que laissées à des reprises manuelles.

Les résultats : 95 % de profils à jour et 36 heures de maintenance rendues chaque mois

IndicateurAvantAprès
Profils à jour62 %95 % (validé par audit interne)
Taux de doublons18 %0,8 %
Mise à jour d'un profil20 minutes, en manuel45 secondes (webhooks n8n)
Charge mensuelle de maintenance40 heures4 heures
Diffusion des signaux carrière2 semaines15 minutes

Les mises à jour, qui demandaient 20 minutes de traitement manuel, se propagent désormais en 45 secondes : 36 heures de maintenance sont économisées chaque mois, l'équivalent d'une semaine-homme rendue aux équipes carrières. La base expose des données fiables à 95 %, ce qui renforce la personnalisation des programmes alumni et la prospection entreprise.

Le monitoring automatisé des changements de poste alimente des alertes exploitées par trois services internes. Sur un an, le bilan du projet fait état d'un retour sur investissement multiplié par 4,2.

Et après ? Scoring prédictif, nouveaux pays et nouvelles cohortes

La feuille de route consolide le socle : passage des validations Great Expectations en mode bloquant, extension de la couverture LinkedIn à de nouveaux pays et ajout d'une couche de scoring prédictif pour qualifier les signaux carrière. Un audit RGPD complétera la documentation technique, et un sprint dédié consolidera la gouvernance des données multi-entités.

Le référentiel est par ailleurs conçu pour s'étendre à d'autres cohortes d'étudiants, avec la même mécanique de collecte, de déduplication et d'enrichissement.

Un défi similaire ? Estimez le gain sur votre propre base de contacts

Base alumni, CRM commercial, fichier d'adhérents : si vos données vieillissent plus vite qu'elles ne se mettent à jour, la mécanique déployée ici (collecte automatisée, déduplication par embeddings, classification LLM, diffusion temps réel) s'applique à vos contacts. Décrivez-nous votre base, ses sources et son taux de doublons : nous vous dirons ce qu'un pipeline équivalent peut changer sur vos volumes.

Pour aller plus loin :

FAQ : fiabiliser une base alumni avec des LLM

Combien coûte un projet de fiabilisation de base de contacts par IA ?

Le budget dépend du nombre de sources à connecter, du volume de profils et du niveau d'enrichissement attendu. Ce projet combine des briques open source (Airbyte, dbt, n8n) et des services managés Google Cloud (BigQuery, Vertex AI), ce qui limite les coûts de licence. Pour des ordres de grandeur par cas d'usage, consultez notre guide sur le prix d'un agent IA en 2026.

À quelle vitesse la base se met-elle à jour une fois le pipeline en place ?

Un changement de poste détecté sur LinkedIn est classé par GPT-4 et propagé dans le référentiel en moins de 15 minutes grâce aux webhooks n8n. À l'échelle d'un profil, la mise à jour qui demandait 20 minutes de traitement manuel prend désormais 45 secondes.

Comment le dispositif gère-t-il la conformité RGPD ?

Le référentiel est aligné sur les standards RGPD : pipeline versionné, transformations tracées et règles de qualité appliquées avant chaque chargement. Un audit RGPD est planifié pour compléter la documentation technique. Pour approfondir l'hébergement des données et des modèles, lisez notre guide IA souveraine et RGPD.

L'approche fonctionne-t-elle pour un CRM commercial ou une base d'adhérents ?

Oui. La mécanique est la même quel que soit le type de contacts : extraction des sources existantes, déduplication par embeddings, détection des changements par LLM et diffusion en temps réel vers les équipes. Seuls changent les connecteurs d'entrée et les règles de scoring propres à votre métier.

Découvrez d’autres cas clients

Voir tous nos articles
Cas client
No items found.

Squareness

Squareness, cabinet indépendant de conseil financier et opérationnel, faisait face à un écart de maturité IA entre ses deux pôles : quelques collaborateurs utilisaient ChatGPT en solo, sans cadre ni cas d'usage partagé. En six jours répartis en trois phases, Koïno a cartographié les workflows réels, construit une formation sur mesure à partir des irritants relevés, puis formé les équipes sur site. Trois mois après, l'IA est entrée dans le quotidien des deux pôles.

Squareness : 100 % des équipes à l'IA et 5 h regagnées par semaine
Finance
Cas client
No items found.

Molydal

Un scan photo ou une saisie vocale, et l'équivalent Molydal d'un produit concurrent apparaît, justifié par sa fiche technique : c'est MolyScan, l'application mobile livrée par Koïno aux équipes commerciales et distributeurs de Molydal, industriel français des solutions de lubrification. Le moteur RAG est 100 % souverain : LLM open source, hébergement français (OVH/Scaleway), zéro API externe. Livré en 12 semaines, du cadrage au déploiement pilote, le dispositif transforme aussi chaque scan en donnée de market intelligence pour la direction.

Industrie