Notre client dans le secteur Banque et finance recherche un/une Ingénieur SRE Senior / Expert DevOps & Observabilité H/F
Description de la mission :
Le client est un acteur majeur du secteur bancaire.
Contexte et objectif de la mission
Dans le cadre de l?évolution de plateformes numériques et du renforcement de la fiabilité de services critiques, l?entreprise recherche un Ingénieur SRE Senior disposant d?une expertise reconnue en DevOps, automatisation, observabilité et supervision. Le candidat retenu intégrera une équipe transverse intervenant sur des environnements de production à forte disponibilité (24/7) afin d?accompagner les équipes de développement et d?exploitation dans l?amélioration de la performance, de la stabilité et de la résilience des systèmes.
La mission s?inscrit au sein d?une équipe d?intégration transverse de la direction de la fabrication, département autorisation, basée à Nanterre. La mission se déroulera partiellement en télétravail.
Missions principales / responsabilités
Pour la direction de la fabrication, département autorisation, la prestation couvre les sujets suivants :
? Garantir la disponibilité et la résilience des plateformes
? Automatiser les processus d?exploitation et de déploiement
? Définir et mettre en ?uvre les standards SRE
? Industrialiser les pratiques DevOps
? Développer et maintenir les plateformes d?observabilité
? Superviser les infrastructures et applications critiques
? Réduire le MTTR (Mean Time To Recovery)
? Mettre en place des indicateurs SLI, SLO et SLA
Profil recherché
Niveau et expérience :
? Domaine d?intervention : SRE Senior
? Type de prestation : expertise technique
Compétences techniques obligatoires :
SRE & Production :
? Expérience significative en ingénierie SRE
? Gestion d?environnements critiques à haute disponibilité
? Mise en ?uvre des concepts SLI, SLO et SLA
? Analyse de performances applicatives
DevOps :
? GitLab CI/CD, GitHub Actions ou Jenkins
? Docker
? Kubernetes
? Helm
? Terraform
? Ansible
Observabilité ? expertise avancée sur :
? Grafana
? Loki
? Prometheus
? Tempo
Systèmes :
? Linux (RedHat, CentOS, Rocky Linux)
? Réseaux TCP/IP
? Sécurité des infrastructures
Langages & scripting :
? Python
? Bash
? Go (apprécié)
Compétences comportementales :
? Esprit d?analyse et de synthèse
? Autonomie, initiative, sens des responsabilités
? Bon relationnel avec des équipes métier et techniques de différentes structures
? Rigueur, organisation, qualités rédactionnelles
Livrables attendus
? Scripts d?amélioration
? Architecture d?observabilité
? Documentation d?exploitation
? Dashboards Grafana
? Catalogue d?alertes
? Rapports de disponibilité
? Rapports d?incidents majeurs
? Plans d?amélioration continue
? Documentation SRE et runbooks
Contraintes et particularités
? Astreintes à assurer pour couvrir les besoins de continuité de service des applications 24/7
? Intervention possible en cas d?incident ou de dysfonctionnement en production
Compétences / Qualités indispensables :
SRE en environnement critique 24/7, DevOps et automatisation, Observabilité (Grafana, Prometheus, Loki, Tempo), Kubernetes, Docker, Terraform, Ansible, Mise en place de SLI/SLO/SLA, Python et Bash
Compétences / Qualités qui seraient un + :
Langage GoInformations concernant le télétravail :
Oui ? 2 jours/semaine
Profil candidat:
SRE en environnement critique 24/7
DevOps et automatisation
Observabilité (Grafana, Prometheus, Loki, Tempo)
Kubernetes, Docker, Terraform, Ansible
Mise en place de SLI/SLO/SLA
Python et Bash