Analyse et interprétation des logs (~50 %) ? priorité n°1
? Analyser et interpréter quotidiennement les logs applicatifs via la stack ELK.
? Identifier les erreurs récurrentes, corréler les signaux et détecter les signaux faibles.
? Rechercher les root causes et faire le lien entre les logs et le code applicatif (Java).
? Être un point d'entrée en amont des incidents : traiter les problématiques avant qu'elles ne deviennent des incidents majeurs.
? Travailler en lien étroit avec les Service Delivery Managers (SDM) sur le suivi et l'analyse des problématiques.
Administration de la stack ELK (~30 %)
? Administrer Elasticsearch, Kibana, Logstash et Filebeat.
? Gérer les index, les politiques ILM et les pipelines de collecte.
? Configurer et faire évoluer l'alerting.
? Contribuer à la dimension observabilité : APM / OpenTelemetry, dashboards, alerting préventif, SLI/SLO.
Montée en compétences des équipes N2 (~20 %)
? Accompagner et coacher les équipes support et développement dans une posture de pédagogue.
? Créer et maintenir des runbooks pour outiller le N2.
? Favoriser l'autonomie des équipes et réduire durablement les escalades vers le N3.
? Présenter analyses et recommandations aux équipes techniques et aux instances de pilotage (SAFe / PI Planning).
Profil candidat:
Nous recherchons un(e) Expert ELK / DevOps orienté RUN pour intervenir en amont des incidents, réduire le recours au support N3 et accompagner la montée en compétences des équipes N2. Ce poste s'adresse à un profil hybride, à la fois technique sur la stack Elastic et proche du code applicatif, avec une vraie appétence pour l'analyse quotidienne et la prévention des incidents plutôt que la seule réaction en cas de crise.
? Formation Bac+5 / école d'ingénieur, profil senior avec une forte expérience en production et environnements critiques.
? Expertise indispensable sur la stack Elastic : Elasticsearch, Kibana, Logstash, Filebeat (administration, index/ILM, pipelines, alerting).
? Forte compétence en analyse de logs et diagnostic production (corrélation, patterns récurrents, signaux faibles, root cause).
? Bonne maîtrise du Java pour faire le lien entre logs et code applicatif ? lecture de code Java : un gros plus.
? Connaissances complémentaires appréciées : Python, JMeter, Kubernetes, PostgreSQL, Cassandra, Jenkins, Sonar, Nexus, CI/CD.
? Véritable posture de coach/pédagogue, à l'aise pour accompagner des équipes et vulgariser des sujets techniques.
? Capacité à conjuguer RUN quotidien et démarche préventive, dans une logique de fiabilité et d'amélioration continue.
? Aisance relationnelle pour interagir avec les SDM et présenter ses travaux en instances de pilotage.