Angelos Lemire
Airbay Data — tous les chantiers03

Le moteur de recherche de profils

Rendre une base de profils interrogeable par le sens plutôt que par mots-clés, et mesurer ce qu'elle vaut vraiment.

Mission en appui — premier projet du stageDébut mars 2026Rôle : persistance et qualité des données
PythonBase vectorielleEmbeddingsAnalyse de données

Le besoin

Mon tout premier projet du stage. À partir d'une question posée en langage naturel, le système devait retrouver les profils les plus pertinents au sein d'une grande base d'anciens élèves. C'est par nature un projet d'administration de données : la valeur ne vient pas de l'interface, mais de la chaîne de traitement qui transforme des profils bruts en données interrogeables.

Ce que j'ai fait

Le moteur préexistait à mon arrivée. Ma contribution a porté sur deux aspects, tous deux centrés sur la donnée. D'une part, j'ai intégré une couche de persistance pour stocker et recharger les jeux de données préparés, avec un mécanisme de cache — sans quoi chaque exécution repartait de zéro.

D'autre part, et c'est le plus formateur, j'ai mené un travail d'exploration et de qualité : analyse statistique du jeu de données — répartition par pays, par secteur, taux de remplissage des champs, doublons, profils sans expérience exploitable — et production d'une documentation technique. Ce travail a mis au jour les forces et les faiblesses réelles du jeu, ce qui est indispensable pour juger si les réponses du moteur sont bonnes ou seulement plausibles.

Ce que j'y ai appris

Du point de vue de l'architecture des données, ce pipeline est un bon exemple de chaîne moderne : collecte depuis des sources externes, structuration en tables exploitables, enrichissement automatique de métadonnées, génération de représentations vectorielles, puis indexation dans une base vectorielle permettant une recherche par similarité plutôt que par mots-clés exacts.

J'y ai découvert concrètement les notions d'embedding, de base vectorielle et de recherche par intention — qui prolongent vers le non structuré les compétences classiques de gestion de données.

Ma contribution y fut ciblée, et je l'assume : c'était un projet de prise en main, en tout début de stage. Mais il a posé un cadre mental que j'ai retrouvé dans tous les chantiers suivants — penser une donnée comme le produit d'un pipeline traçable.