Lefebvre Dalloz est la marque française du groupe européen Lefebvre, leader européen des services juridiques et fiscaux qui accompagne au quotidien plus de 275 000 clients grâce à une offre globale de contenus, de formation et de logiciels et services.
Depuis plus de 100 ans, nos rédacteurs experts de l’édition juridique et fiscale produisent des contenus fiables, actualisés en temps réel et opérationnels au quotidien. Pionnier de l’innovation dans le secteur juridique en Europe, le Groupe Lefebvre a lancé début 2024 son offre GenIA-L (IA juridique) sur l’ensemble de ses marchés accompagnant ainsi ses clients dans la transformation de leurs métiers.
Lefebvre Dalloz compte 1 200 collaborateurs en France et a réalisé un chiffre d’affaires de 301 millions d’euros en 2024. Sa raison d’être : activer la connaissance pour une société plus juste, efficace et durable.
Aux côtés d’une équipe d’experts passionnés au sein de l’équipe AI Service, vous relèverez les défis techniques les plus ambitieux du Groupe et du marché de l’édition juridique.
En tant qu’Expert Data & Retrieval, vous êtes le garant de la matière première de notre IA : la collecte, l’ingestion, l’indexation et la recherche de pertinence sur des volumes juridiques massifs. Votre travail constitue le socle qui alimente nos modèles de langage, nos moteurs de recherche et nos produits d’IA générative.
Votre terrain de jeu : transformer la manière dont tout un secteur, le droit, travaille au quotidien.
Votre mission n’est pas d’écrire un simple script, mais de concevoir des pipelines de données robustes capables d’ingérer, nettoyer et indexer d’immenses corpus juridiques, puis d’exposer une recherche rapide et pertinente, à la fois sémantique et hybride, au service de plusieurs équipes à travers l’Europe.
Vous garantirez la fraîcheur des index, la qualité du retrieval et la pertinence des résultats tout en relevant des défis techniques complexes liés à la volumétrie, à l’hétérogénéité des sources, à la scalabilité et à l’évaluation continue des performances.
Vos missions principales : bâtir, outiller, transmettre
1. Collecte, ingestion & indexation
Pipelines d’ingestion
-
Concevoir et industrialiser la collecte de données issues de sources variées : contenus éditoriaux, open data, bases juridiques et référentiels internes.
-
Concevoir les chaînes de parsing, nettoyage, normalisation et structuration des documents.
-
Définir les meilleures stratégies de chunking adaptées aux usages IA et RAG.
Indexation & Embeddings
-
Sélectionner et industrialiser les modèles d’embeddings adaptés aux contenus juridiques.
-
Alimenter, optimiser et maintenir les bases vectorielles.
-
Gérer les reconstructions d’index et garantir leur fraîcheur.
-
Participer à l’amélioration continue des mécanismes de recherche documentaire.
Qualité & Volumétrie
-
Garantir la scalabilité des pipelines sur des corpus documentaires massifs.
-
Mettre en œuvre les mécanismes de traçabilité et de lignage des données.
-
Assurer le versioning des datasets et des index.
2. Recherche & Pertinence (Retrieval)
Stratégie de Retrieval
-
Concevoir les mécanismes de recherche hybride combinant recherche lexicale et recherche sémantique.
-
Combiner efficacement BM25, embeddings, filtrage par métadonnées et reranking.
-
Optimiser la pertinence des résultats pour les utilisateurs finaux et les systèmes d’IA.
Évaluation Continue
-
Construire des jeux de tests représentatifs des cas d’usage métier.
-
Définir et suivre les métriques de pertinence :
-
Recall
-
Precision
-
nDCG
-
MRR
-
Piloter une démarche continue d’amélioration de la qualité du retrieval.
RAG & IA Générative
-
Concevoir la couche de récupération de contexte alimentant les LLM.
-
Gérer les problématiques de déduplication, citations, gestion du contexte et pertinence documentaire.
-
Participer à l’évolution des architectures RAG du Groupe.
Observability & Security
-
Instrumenter les pipelines avec des logs, métriques et traces de qualité.
-
Garantir la conformité des traitements de données aux exigences réglementaires (RGPD notamment).
-
Assurer le cloisonnement des données dans un contexte multi-pays.
3. Leadership Technique & Gouvernance
Excellence Engineering
-
Promouvoir les bonnes pratiques de développement :
-
Clean Code
-
SOLID
-
revue de code
-
automatisation des tests
Accompagnement & Transmission
-
Être référent sur les sujets Data Engineering, Search et Retrieval.
-
Accompagner les équipes produits et IA sur les problématiques de recherche documentaire.
Rayonnement Technique
-
Assurer une veille technologique constante.
-
Contribuer au rayonnement technique du Groupe :
-
articles techniques,
-
conférences,
-
meetups,
-
open source.
Profil recherché
Formation
-
Master, diplôme d’Ingénieur, PhD ou équivalent.
Expérience
-
Expérience avérée en Data Engineering et/ou Information Retrieval sur des environnements de production à forte volumétrie.
-
Expérience significative dans la conception et l’exploitation de moteurs de recherche, plateformes documentaires ou systèmes RAG.
-
Anglais courant indispensable dans un contexte de collaboration européenne.
Compétences requises
Stack cible (à challenger)
Langages
-
Python 3.11+ (maîtrise indispensable)
-
Go
Indexation & Search
-
PgVector
-
Weaviate
-
Qdrant
-
OpenSearch
-
Recherche hybride
-
BM25
Embeddings & NLP
-
Sentence Transformers
-
Modèles d’embeddings
-
Tokenisation
-
Parsing documentaire
-
NLP
RAG & LLM
-
LangChain
-
Architectures RAG
-
Reranking
-
OpenAI
-
Mistral AI
-
AWS Bedrock
Data & Infrastructure
-
PostgreSQL
-
Airflow
-
Spark ou équivalent
-
Kafka
-
Redis
-
Docker
-
Kubernetes
-
CI/CD
Tests & Évaluation
-
Pytest
-
Recall
-
nDCG
-
MRR
-
Évaluation de la pertinence
Compétences attendues
Expertise Data Engineering & Retrieval
Vous maîtrisez l’ensemble de la chaîne de valeur de la recherche documentaire moderne :
-
ingestion de données,
-
indexation,
-
embeddings,
-
recherche hybride,
-
vector search,
-
reranking.
Vous savez mesurer objectivement la qualité des résultats et mettre en œuvre les actions nécessaires pour améliorer la pertinence.
Culture Data
Vous appliquez les meilleures pratiques de gestion des données :
-
pipelines reproductibles,
-
qualité et gouvernance des données,
-
lignage,
-
métadonnées,
-
versioning des datasets,
-
versioning des index.
Solide culture IA / ML
Vous possédez une bonne compréhension des technologies IA modernes :
-
NLP,
-
embeddings,
-
architectures RAG,
-
fonctionnement des LLM.
Sans être nécessairement spécialiste du serving ou du fine-tuning, vous comprenez parfaitement le rôle du Retrieval dans la performance des systèmes d’IA générative.
Polyvalence appréciée
Une expérience complémentaire sur d’autres langages, notamment Java, constitue un atout pour contribuer à des sujets transverses.
Langues
-
Français courant
-
Anglais courant
Soft Skills
Vision Produit
Vous comprenez les enjeux métiers des professionnels du droit pour prioriser les fonctionnalités.
Vous considérez vos index, vos pipelines et votre moteur de recherche comme un véritable produit.
Les développeurs qui consomment vos services sont vos premiers clients.
Leadership Technique & Pédagogie
Vous aimez partager vos connaissances et accompagner la montée en compétence des équipes.
Vous êtes capable d’évangéliser les bonnes pratiques Data, Retrieval et IA à travers l’ensemble de l’organisation.
Obsession de la Qualité
Vous faites preuve d’une exigence absolue concernant :
-
la qualité des données,
-
la pertinence des résultats,
-
la sécurité,
-
la conformité,
-
la fiabilité des services.
Esprit d’Innovation
Vous êtes curieux des évolutions de l’écosystème :
-
IA générative,
-
NLP,
-
Search,
-
Vector Databases,
-
RAG,
-
Retrieval.
Communication
Vous savez vulgariser des concepts complexes et collaborer efficacement avec des interlocuteurs techniques comme métiers.
Pourquoi ce poste est unique ?
Un rôle stratégique avec un fort pouvoir d’influence
Vous intervenez au moment où les décisions structurantes sont prises.
Vous disposez d’un réel pouvoir d’influence sur les choix technologiques et l’évolution de la plateforme IA du Groupe.
Une complexité métier stimulante
Indexer, structurer et rendre pertinent un patrimoine juridique massif, riche et hétérogène constitue un défi data particulièrement rare.
Votre impact sera direct sur la qualité des services d’IA générative utilisés quotidiennement par des milliers de professionnels du droit.
Une vision long terme
Nous ne cherchons pas simplement à délivrer des fonctionnalités.
Notre ambition est de construire les standards industriels qui équiperont le Groupe pour les années à venir.
Une aventure humaine avant tout
Vous rejoignez une équipe d’experts reconnue, soudée et bienveillante.
Cette opportunité est pensée pour vous inscrire durablement dans l’entreprise, avec une forte exposition stratégique, une culture d’excellence et de réelles perspectives d’évolution.
Envie de construire le moteur de recherche et les fondations data qui alimenteront l’IA juridique de demain ? Rejoignez-nous.
#DataEngineering #InformationRetrieval #Search #Retrieval #RAG #GenAI #LLM #OpenSearch #Weaviate #Qdrant #Python #Kafka #Spark #NLP #Embeddings #LegalTech #AIEngineering #Hiring #MistralAI #OpenAI