Le moteur de recherche de profils
Rendre une base de profils interrogeable par le sens plutôt que par mots-clés, et mesurer ce qu'elle vaut vraiment.
Le besoin
Mon tout premier projet du stage. À partir d'une question posée en langage naturel, le système devait retrouver les profils les plus pertinents au sein d'une grande base d'anciens élèves. C'est par nature un projet d'administration de données : la valeur ne vient pas de l'interface, mais de la chaîne de traitement qui transforme des profils bruts en données interrogeables.
Ce que j'ai fait
Le moteur préexistait à mon arrivée. Ma contribution a porté sur deux aspects, tous deux centrés sur la donnée. D'une part, j'ai intégré une couche de persistance pour stocker et recharger les jeux de données préparés, avec un mécanisme de cache — sans quoi chaque exécution repartait de zéro.
D'autre part, et c'est le plus formateur, j'ai mené un travail d'exploration et de qualité : analyse statistique du jeu de données — répartition par pays, par secteur, taux de remplissage des champs, doublons, profils sans expérience exploitable — et production d'une documentation technique. Ce travail a mis au jour les forces et les faiblesses réelles du jeu, ce qui est indispensable pour juger si les réponses du moteur sont bonnes ou seulement plausibles.
Ce que j'y ai appris
Du point de vue de l'architecture des données, ce pipeline est un bon exemple de chaîne moderne : collecte depuis des sources externes, structuration en tables exploitables, enrichissement automatique de métadonnées, génération de représentations vectorielles, puis indexation dans une base vectorielle permettant une recherche par similarité plutôt que par mots-clés exacts.
J'y ai découvert concrètement les notions d'embedding, de base vectorielle et de recherche par intention — qui prolongent vers le non structuré les compétences classiques de gestion de données.
Ma contribution y fut ciblée, et je l'assume : c'était un projet de prise en main, en tout début de stage. Mais il a posé un cadre mental que j'ai retrouvé dans tous les chantiers suivants — penser une donnée comme le produit d'un pipeline traçable.