Dans le cadre de la stratégie de l'entreprise, le/la Senior MLOps Engineer construit et opère l'infrastructure et les plateformes qui font tourner notre nouvelle ligne de produits AI managés (l'inférence en tête), en s'appuyant sur les dizaines de milliers de GPU dont dispose Shadow.
Nos heures creuses sont les heures pleines des entreprises B2B : nos GPU, principalement sollicités la nuit par nos gamers, représentent une forte capacité de calcul que nous voulons valoriser pour devenir un leader du spot inference.
Le/la Senior MLOps Engineer est garant(e) de la fiabilité, de la performance et de l'efficience (coût/GPU) des systèmes de mise en production des modèles : pipelines de déploiement, scaling, observabilité, et automatisation de bout en bout. Il/elle apporte une expertise senior sur l'exploitation à grande échelle de charges d'inférence sur GPU en environnement multi-tenant.
Le poste est hands-on et à fort impact : concevoir et implémenter les fondations MLOps, mais aussi établir les standards, mentorer les contributeurs et influencer les choix d'architecture aux côtés du Head of PaaS. Dans un contexte de bootstrap, l'autonomie, le sens de l'ownership et la capacité à trancher techniquement sont déterminants.
Rattaché(e) au Head of PaaS, il/elle veille à la bonne mise en œuvre des processus, des méthodes et des niveaux d'exigence fixés globalement pour toutes les équipes, et participe à la vie de l'Engineering avec les autres contributeurs et équipes.
Dans ce rôle :
- Vous concevrez, implémenterez et opérerez les pipelines de déploiement et de serving des modèles d'inférence (CI/CD, model registry, rollout).
- Vous construirez et exploiterez le moteur de spot inference valorisant la capacité GPU non-utilisée en heures creuses.
- Vous mettrez en place l'observabilité, le monitoring et l'alerting (latence, débit, saturation GPU, SLO/SLA).
- Vous optimiserez l'efficience GPU : autoscaling, packing, scheduling et multi-tenancy.
- Vous automatiserez le provisioning et la configuration de l'infrastructure (IaC, GitOps).
- Vous assurerez le maintien en condition opérationnel (MCO), la gestion des incidents et l'amélioration continue de la fiabilité (SRE).
- Vous définirez les standards MLOps, mentorerez les contributeurs et diffuserez les bonnes pratiques.
- Vous collaborerez étroitement avec les équipes Foundations, Engine, Produit et Business pour livrer la roadmap
Profil recherché
Vous ne vous reconnaissez pas à 100 % dans les critères ci-dessous ? Aucun problème, envoyez quand même votre CV ! Tous les critères ne sont pas éliminatoires : votre passion, votre curiosité et votre motivation nous aideront à vous faire grandir 😉
- Vous disposez d'une expertise confirmée du serving et des frameworks d'inférence AI (vLLM, TensorRT-LLM, Triton, TGI, SGLang ou équivalents).
- Vous justifiez d'une solide expérience MLOps/SRE : CI/CD de modèles, model registry, déploiement, rollback et gestion de production à grande échelle.
- Vous maîtrisez en profondeur les environnements GPU (CUDA, scheduling, multi-tenancy, MIG/vGPU).
- Vous êtes à l'aise avec Kubernetes et les conteneurs ; idéalement QEMU/KVM et des notions de virtualisation.
- Vous connaissez bien l'Infrastructure as Code et le GitOps (Terraform, Ansible, ArgoCD ou équivalents).
- Vous savez mettre en œuvre l'observabilité (Prometheus, Grafana, tracing, logging) et définir des SLO/SLA.
- Vous maîtrisez Python ; la connaissance d'un autre langage système (Go, Rust, C++) est un fort atout.
- Vous êtes capable de coder, debugger, profiler et livrer concrètement (hands-on).
- Vous connaissez le marché de l'inférence managée et des produits concurrents.
- Vous avez un ownership fort : capable de vous approprier des systèmes critiques et d'en garantir la fiabilité de bout en bout.
- Vous avez l'esprit produit : vous savez prioriser, trancher et faire le pont entre l'engineering et le business.
- Vous savez articuler une réflexion technique, l'illustrer par des analyses et débattre lors de prises de décision collectives.
- Vous êtes en mesure de définir des standards techniques et d'influencer les choix d'architecture.
- Vous aimez mentorer, donner du feedback et accompagner la montée en maturité de l'équipe.
- Vous êtes autonome, proactif et orienté solutions.
- Vous êtes à l'aise dans un contexte de bootstrap : capable de passer du code à la stratégie dans la même journée.
- Vous communiquez avec aisance, à l'oral comme à l'écrit.
- Vous collaborez fortement avec les autres équipes en position de facilitateur.
Déroulement des entretiens
Nous vous proposons un premier échange téléphonique de 30 minutes avec un membre de l’équipe RH, pour faire connaissance et vous présenter le poste.
Si ce premier échange est concluant, nous organisons ensuite :
- Un entretien technique et culturel (1h) avec notre Head of PaaS.
- Un entretien (1h00) - avec deux membres de notre équipe
- Entretien final dans nos locaux (30 min) - Avec notre CTO et une rencontre