AI Jobs Map

LEFEBVRE DALLOZ · 92400 Courbevoie

Tech lead Expert Data Retrieval RAG

directorPosted 13 days ago
Apply on IndeedIndeedOpens the original posting. AI Jobs Map never asks for your details.

Stack mentioned

ragvector-databasesllmobservabilitydata-engineeringpythonweaviateqdrantelasticsearchnlptransformerslangchainopenaiawspostgresqlapache-airflowapache-kafkaredisdockerkubernetes

Lefebvre Dalloz est la marque française du groupe européen Lefebvre, leader européen des services juridiques et fiscaux qui accompagne au quotidien plus de 275 000 clients grâce à une offre globale de contenus, de formation et de logiciels et services.

Depuis plus de 100 ans, nos rédacteurs experts de l’édition juridique et fiscale produisent des contenus fiables, actualisés en temps réel et opérationnels au quotidien. Pionnier de l’innovation dans le secteur juridique en Europe, le Groupe Lefebvre a lancé début 2024 son offre GenIA-L (IA juridique) sur l’ensemble de ses marchés accompagnant ainsi ses clients dans la transformation de leurs métiers.

Lefebvre Dalloz compte 1 200 collaborateurs en France et a réalisé un chiffre d’affaires de 301 millions d’euros en 2024. Sa raison d’être : activer la connaissance pour une société plus juste, efficace et durable.

Aux côtés d’une équipe d’experts passionnés au sein de l’équipe AI Service, vous relèverez les défis techniques les plus ambitieux du Groupe et du marché de l’édition juridique.

En tant qu’Expert Data & Retrieval, vous êtes le garant de la matière première de notre IA : la collecte, l’ingestion, l’indexation et la recherche de pertinence sur des volumes juridiques massifs. Votre travail constitue le socle qui alimente nos modèles de langage, nos moteurs de recherche et nos produits d’IA générative.

Votre terrain de jeu : transformer la manière dont tout un secteur, le droit, travaille au quotidien.

Votre mission n’est pas d’écrire un simple script, mais de concevoir des pipelines de données robustes capables d’ingérer, nettoyer et indexer d’immenses corpus juridiques, puis d’exposer une recherche rapide et pertinente, à la fois sémantique et hybride, au service de plusieurs équipes à travers l’Europe.

Vous garantirez la fraîcheur des index, la qualité du retrieval et la pertinence des résultats tout en relevant des défis techniques complexes liés à la volumétrie, à l’hétérogénéité des sources, à la scalabilité et à l’évaluation continue des performances.

Vos missions principales : bâtir, outiller, transmettre

1. Collecte, ingestion & indexation

Pipelines d’ingestion

-

Concevoir et industrialiser la collecte de données issues de sources variées : contenus éditoriaux, open data, bases juridiques et référentiels internes.

-

Concevoir les chaînes de parsing, nettoyage, normalisation et structuration des documents.

-

Définir les meilleures stratégies de chunking adaptées aux usages IA et RAG.

Indexation & Embeddings

-

Sélectionner et industrialiser les modèles d’embeddings adaptés aux contenus juridiques.

-

Alimenter, optimiser et maintenir les bases vectorielles.

-

Gérer les reconstructions d’index et garantir leur fraîcheur.

-

Participer à l’amélioration continue des mécanismes de recherche documentaire.

Qualité & Volumétrie

-

Garantir la scalabilité des pipelines sur des corpus documentaires massifs.

-

Mettre en œuvre les mécanismes de traçabilité et de lignage des données.

-

Assurer le versioning des datasets et des index.

2. Recherche & Pertinence (Retrieval)

Stratégie de Retrieval

-

Concevoir les mécanismes de recherche hybride combinant recherche lexicale et recherche sémantique.

-

Combiner efficacement BM25, embeddings, filtrage par métadonnées et reranking.

-

Optimiser la pertinence des résultats pour les utilisateurs finaux et les systèmes d’IA.

Évaluation Continue

-

Construire des jeux de tests représentatifs des cas d’usage métier.

-

Définir et suivre les métriques de pertinence :

-

Recall

-

Precision

-

nDCG

-

MRR

-

Piloter une démarche continue d’amélioration de la qualité du retrieval.

RAG & IA Générative

-

Concevoir la couche de récupération de contexte alimentant les LLM.

-

Gérer les problématiques de déduplication, citations, gestion du contexte et pertinence documentaire.

-

Participer à l’évolution des architectures RAG du Groupe.

Observability & Security

-

Instrumenter les pipelines avec des logs, métriques et traces de qualité.

-

Garantir la conformité des traitements de données aux exigences réglementaires (RGPD notamment).

-

Assurer le cloisonnement des données dans un contexte multi-pays.

3. Leadership Technique & Gouvernance

Excellence Engineering

-

Promouvoir les bonnes pratiques de développement :

-

Clean Code

-

SOLID

-

revue de code

-

automatisation des tests

Accompagnement & Transmission

-

Être référent sur les sujets Data Engineering, Search et Retrieval.

-

Accompagner les équipes produits et IA sur les problématiques de recherche documentaire.

Rayonnement Technique

-

Assurer une veille technologique constante.

-

Contribuer au rayonnement technique du Groupe :

-

articles techniques,

-

conférences,

-

meetups,

-

open source.

Profil recherché

Formation

-

Master, diplôme d’Ingénieur, PhD ou équivalent.

Expérience

-

Expérience avérée en Data Engineering et/ou Information Retrieval sur des environnements de production à forte volumétrie.

-

Expérience significative dans la conception et l’exploitation de moteurs de recherche, plateformes documentaires ou systèmes RAG.

-

Anglais courant indispensable dans un contexte de collaboration européenne.

Compétences requises

Stack cible (à challenger)

Langages

-

Python 3.11+ (maîtrise indispensable)

-

Go

Indexation & Search

-

PgVector

-

Weaviate

-

Qdrant

-

OpenSearch

-

Recherche hybride

-

BM25

Embeddings & NLP

-

Sentence Transformers

-

Modèles d’embeddings

-

Tokenisation

-

Parsing documentaire

-

NLP

RAG & LLM

-

LangChain

-

Architectures RAG

-

Reranking

-

OpenAI

-

Mistral AI

-

AWS Bedrock

Data & Infrastructure

-

PostgreSQL

-

Airflow

-

Spark ou équivalent

-

Kafka

-

Redis

-

Docker

-

Kubernetes

-

CI/CD

Tests & Évaluation

-

Pytest

-

Recall

-

nDCG

-

MRR

-

Évaluation de la pertinence

Compétences attendues

Expertise Data Engineering & Retrieval

Vous maîtrisez l’ensemble de la chaîne de valeur de la recherche documentaire moderne :

-

ingestion de données,

-

indexation,

-

embeddings,

-

recherche hybride,

-

vector search,

-

reranking.

Vous savez mesurer objectivement la qualité des résultats et mettre en œuvre les actions nécessaires pour améliorer la pertinence.

Culture Data

Vous appliquez les meilleures pratiques de gestion des données :

-

pipelines reproductibles,

-

qualité et gouvernance des données,

-

lignage,

-

métadonnées,

-

versioning des datasets,

-

versioning des index.

Solide culture IA / ML

Vous possédez une bonne compréhension des technologies IA modernes :

-

NLP,

-

embeddings,

-

architectures RAG,

-

fonctionnement des LLM.

Sans être nécessairement spécialiste du serving ou du fine-tuning, vous comprenez parfaitement le rôle du Retrieval dans la performance des systèmes d’IA générative.

Polyvalence appréciée

Une expérience complémentaire sur d’autres langages, notamment Java, constitue un atout pour contribuer à des sujets transverses.

Langues

-

Français courant

-

Anglais courant

Soft Skills

Vision Produit

Vous comprenez les enjeux métiers des professionnels du droit pour prioriser les fonctionnalités.

Vous considérez vos index, vos pipelines et votre moteur de recherche comme un véritable produit.

Les développeurs qui consomment vos services sont vos premiers clients.

Leadership Technique & Pédagogie

Vous aimez partager vos connaissances et accompagner la montée en compétence des équipes.

Vous êtes capable d’évangéliser les bonnes pratiques Data, Retrieval et IA à travers l’ensemble de l’organisation.

Obsession de la Qualité

Vous faites preuve d’une exigence absolue concernant :

-

la qualité des données,

-

la pertinence des résultats,

-

la sécurité,

-

la conformité,

-

la fiabilité des services.

Esprit d’Innovation

Vous êtes curieux des évolutions de l’écosystème :

-

IA générative,

-

NLP,

-

Search,

-

Vector Databases,

-

RAG,

-

Retrieval.

Communication

Vous savez vulgariser des concepts complexes et collaborer efficacement avec des interlocuteurs techniques comme métiers.

Pourquoi ce poste est unique ?

Un rôle stratégique avec un fort pouvoir d’influence

Vous intervenez au moment où les décisions structurantes sont prises.

Vous disposez d’un réel pouvoir d’influence sur les choix technologiques et l’évolution de la plateforme IA du Groupe.

Une complexité métier stimulante

Indexer, structurer et rendre pertinent un patrimoine juridique massif, riche et hétérogène constitue un défi data particulièrement rare.

Votre impact sera direct sur la qualité des services d’IA générative utilisés quotidiennement par des milliers de professionnels du droit.

Une vision long terme

Nous ne cherchons pas simplement à délivrer des fonctionnalités.

Notre ambition est de construire les standards industriels qui équiperont le Groupe pour les années à venir.

Une aventure humaine avant tout

Vous rejoignez une équipe d’experts reconnue, soudée et bienveillante.

Cette opportunité est pensée pour vous inscrire durablement dans l’entreprise, avec une forte exposition stratégique, une culture d’excellence et de réelles perspectives d’évolution.

Envie de construire le moteur de recherche et les fondations data qui alimenteront l’IA juridique de demain ? Rejoignez-nous.

#DataEngineering #InformationRetrieval #Search #Retrieval #RAG #GenAI #LLM #OpenSearch #Weaviate #Qdrant #Python #Kafka #Spark #NLP #Embeddings #LegalTech #AIEngineering #Hiring #MistralAI #OpenAI

More jobs at LEFEBVRE DALLOZ