Missions principales
Le Domain Manager a pour mission de garantir la stabilité, la performance et la disponibilité des services sur les environnements de production et hors production, tout en promouvant une culture orientée fiabilité au sein des équipes.
À ce titre, il :
S'assure que les évolutions produits respectent les exigences de qualité avant leur mise en production.
Maintient un équilibre entre innovation, rapidité de livraison et robustesse opérationnelle.
Travaille en étroite collaboration avec les équipes Produit, Techniques et Plateforme afin d'améliorer continuellement la résilience des services.
Responsabilités
Fiabilité et observabilité
Définir, suivre et communiquer les Service Level Objectives (SLOs).
Mettre en place et piloter les Service Level Indicators (SLIs) et les Error Budgets.
Garantir la mise en ?uvre et l'amélioration continue des dispositifs d'observabilité, de monitoring et d'alerting sur l'ensemble du domaine applicatif.
Gouvernance des mises en production
Superviser la préparation opérationnelle des releases.
Assurer la stabilité de la production grâce à une coordination transverse avec les équipes Produit et Techniques.
Disposer d'un rôle de validation finale des mises en production et pouvoir bloquer une livraison lorsque les indicateurs qualité ne sont pas alignés avec les attentes des utilisateurs.
Gestion des incidents et amélioration continue
Piloter la gestion des incidents.
Organiser et animer les analyses de causes racines (Root Cause Analysis).
Conduire les revues post-mortem afin de renforcer la responsabilisation des équipes et l'amélioration continue.
Résilience et optimisation
Collaborer avec les équipes Plateforme et les équipes spécialisées en observabilité, performance et optimisation des coûts.
Renforcer la résilience des systèmes.
Contribuer à l'amélioration de l'efficacité opérationnelle et à la maîtrise des coûts d'exploitation.
Pilotage et coordination
Produire un reporting régulier sur la fiabilité des services, les risques identifiés et les plans d'amélioration.
Fournir une visibilité claire aux responsables de programme, managers et parties prenantes métier.
Participer activement aux cérémonies de pilotage Agile en portant les enjeux de fiabilité, de qualité et d'exploitation.
Profil candidat:
Profil recherché
Compétences techniques
Expertise confirmée en Site Reliability Engineering (SRE) dans des environnements SaaS ou cloud-native.
Maîtrise des concepts d'observabilité, d'automatisation et des outils de supervision.
Expérience significative dans la définition et le pilotage de SLOs, SLIs et Error Budgets en collaboration avec les équipes d'ingénierie.
Bonne maîtrise des pratiques DevSecOps, des chaînes CI/CD et du monitoring continu.
Compétences fonctionnelles
Solide expérience en gestion d'incidents et préparation opérationnelle.
Capacité démontrée à coordonner des initiatives de fiabilité impliquant des équipes Produit, Techniques et Plateforme.
Forte sensibilité aux indicateurs de performance, à la prévention des causes racines et à la gouvernance opérationnelle.
Qualités personnelles
Esprit analytique et approche orientée données.
Rigueur dans le suivi des indicateurs et la prise de décision.
Excellentes capacités de coordination et de communication transverse.
Culture de l'amélioration continue et de l'excellence opérationnelle.
Points clés à retenir
Poste orienté SRE / fiabilité opérationnelle.
Rôle transverse entre les équipes Produit, Tech et Plateforme.
Responsabilité forte sur la qualité des mises en production avec un véritable pouvoir de validation.
Pilotage des SLO/SLI, observabilité, incidents et amélioration continue.
Environnement SaaS / Cloud Native avec forte maturité DevSecOps.