Rejoignez le Groupe Havana en tant qu'ingénieur d'exploitation cloud (F/H) sur Grenoble !
Contexte
La mission s'inscrit dans un environnement critique à forte volumétrie nécessitant un haut niveau de disponibilité, de sécurité et de qualité de service.
Objectif de la mission
Assurer le maintien en condition opérationnelle et de sécurité des plateformes, accompagner les évolutions techniques et garantir le respect des engagements de service auprès du client.
Activités principales
Assurer l'exploitation quotidienne des environnements Production et Hors Production.
Traiter les incidents, problèmes et demandes de service.
Réaliser les changements techniques, patching et opérations de maintenance.
Superviser les infrastructures et applications via les outils de monitoring.
Analyser et résoudre les incidents complexes en coordination avec les équipes TMA, TME et hébergeur.
Participer aux mises en production et aux opérations de bascule.
Produire les rapports d'exploitation et indicateurs de service.
Contribuer à la gestion des vulnérabilités et au maintien de la conformité sécurité.
Participer aux instances opérationnelles (Daily, cellules de crise).
Mettre en ?uvre des actions d'amélioration continue, d'automatisation et d'industrialisation des processus d'exploitation.
Environnement technique
Linux RedHat
PostgreSQL, MongoDB
Kafka
OVH Cloud SecNumCloud
Dynatrace, Zabbix, Grafana, Promotheus
ServiceNow
Wallix
Réseaux et sécurité
Automatisation et supervision Cloud
Profil candidat:
Compétences attendues
Exploitation systèmes Linux et middleware.
Gestion des incidents et des changements.
Diagnostic et résolution de problèmes complexes.
Connaissance des processus ITIL.
Capacité à travailler dans un écosystème multi-acteurs.
Communication et coordination opérationnelle.
Esprit d'amélioration continue et d'automatisation.
Livrables
Rapports d'exploitation quotidiens et mensuels.
Comptes-rendus d'incidents et analyses de causes.
Procédures d'exploitation et documents RUN.
Tableaux de bord de supervision.
Plans d'amélioration continue et de réduction des risques.
Valeur ajoutée attendue
Garantir la continuité de service des applications critiques.
Améliorer la résilience des plateformes.
Réduire les incidents récurrents.
Industrialiser les opérations et renforcer l'observabilité.
Contribuer à la réussite des montées en charge des plateformes.