AI Jobs Map

Ampere Software Technology · Toulouse, Occitanie, France

CS27 Bac +5 Stagiaire IA Analyse et Triage d’Incidents DevOps H/F

full timePosted 14 days ago
Apply on LinkedInLinkedInOpens the original posting. AI Jobs Map never asks for your details.

Stack mentioned

devopskubernetesgitlab-ciprometheusgrafanaelasticsearchllmcopilotvllmpython

Contexte Et Environnement De Travail

Ampere Software Technology est une filiale tech software de Renault Group, dédiée au développement logiciel embarqué et aux systèmes d'information du véhicule de demain.

Basée à Toulouse, notre équipe DevOps opère une plateforme “Software Factory”critique en environnement “on-premise” : Kubernetes, GitLab CI/CD, Prometheus, Grafana, et une stack d'analyse de logs ELK (Elasticsearch, Logstash, Kibana).

Dans un contexte de transformation numérique accélérée, nous intégrons l'intelligence artificielle au cœur de nos pratiques DevOps pour améliorer la résilience de nos systèmes et réduire les temps de résolution d'incidents.

La croissance de notre plateforme génère un volume croissant d'alertes, de métriques et de logs. Les équipes ops font face à un défi majeur : trier rapidement les incidents, identifier leurs causes racines et prioriser les actions correctives dans un environnement distribué complexe.

L'objectif de ce stage est de concevoir et prototyper un agent IA capable d'assister les équipes dans la détection, l'analyse et le triage des incidents, en s'appuyant sur les données issues de notre stack de monitoring et d'analyse de logs.

Vos Missions

Le stagiaire sera pleinement acteur de la solution, de la conception à la mise en œuvre. Il sera force de proposition sur les choix techniques et architecturaux, qu'il devra argumenter et défendre auprès de l'équipe, tout en

bénéficiant d'un encadrement expérimenté.

Phase 1 — Agent IA sur la stack monitoring (mois 1 à 3)

- Analyser et comprendre les flux de données issus de Prometheus et Grafana (alertes, métriques, séries temporelles)

- Concevoir l'architecture de l'agent IA : pipeline de collecte, modèle de traitement, interface de restitution

- Prototyper un agent capable de corréler des alertes multi-sources, d'identifier des patterns d'incidents récurrents et de proposer un diagnostic en langage naturel

- Évaluer et proposer la stratégie LLM : GitHub Copilot (disponible en interne), modèles locaux open-source (Ollama, vLLM) ou approche hybride, avec analyse coût/ROI argumentée

Phase 2 — Extension à la stack ELK / analyse de logs (mois 4 à 6)

- Intégrer les données de logs Kibana/Elasticsearch dans le pipeline de l'agent

- Enrichir les capacités de diagnostic : analyse de logs applicatifs, détection d'anomalies, identification de root cause à partir de traces

- Valider la solution sur des scénarios d'incidents réels ou simulés

- Documenter l'architecture, les choix techniques retenus et les perspectives d'industrialisation

Qui êtes vous ?

- Étudiant(e) en dernière année d'école d'ingénieur ou de master (Bac+5), spécialisation informatique,

- DevOps, cloud ou data/IA

- Solides bases en développement backend — Python requis

- Curiosité et appétence pour les LLMs, les agents IA et le domaine DevOps/Ops

- Connaissance ou intérêt pour Kubernetes, Prometheus, Grafana et la stack ELK

- Capacité à proposer, argumenter et défendre des choix techniques devant une équipe expérimentée

- Autonomie, rigueur et esprit d'initiative

Vous souhaitez participer à l’aventure de l’automobile de demain ? Rejoignez-nous ! 🚗💡

More jobs at Ampere Software Technology