Au sein de l'équipe Supervision de la DSI, composée de 10 collaborateurs, vous contribuez au maintien en conditions opérationnelles et à la surveillance d'un parc de plus de 350 applications métiers critiques.
Dans un environnement fortement orienté exploitation et monitoring temps réel, vous jouez un rôle central dans la disponibilité des services en garantissant une visibilité permanente sur la santé des infrastructures et des applications.
Véritable référent sur les sujets de supervision Linux et de visualisation de données, vous participez à l'amélioration continue des outils, des processus et des capacités de détection de l'organisation.
Vos principales responsabilités :
Administrer, maintenir et faire évoluer les plateformes de supervision sous Linux.
Concevoir, développer et optimiser les tableaux de bord Grafana afin d'offrir une vision claire et pertinente des indicateurs clés.
Définir et mettre en ?uvre les métriques de disponibilité, de performance et de capacité des applications et infrastructures.
Superviser les alertes, analyser les incidents et conduire les investigations nécessaires à l'identification des causes racines.
Participer à l'amélioration continue des dispositifs de monitoring et à l'automatisation des tâches récurrentes.
Accompagner les équipes techniques dans l'intégration de nouvelles applications et nouveaux services au sein de la plateforme de supervision.
Garantir la fiabilité, la pertinence et la qualité des mécanismes de surveillance dans un environnement à forte volumétrie.
Contribuer à l'industrialisation des pratiques d'exploitation et de supervision.
Rédiger et maintenir la documentation technique ainsi que les procédures d'exploitation.
Profil candidat:Technical skills :
Vous disposez d'une expérience significative dans l'administration Linux et les outils de supervision. Vous appréciez les environnements critiques où la réactivité, la rigueur et l'esprit d'analyse sont essentiels pour garantir la continuité de service.
Systèmes et exploitation
Très bonne maîtrise des environnements Linux (Red Hat, CentOS, Ubuntu ou équivalent)
Administration et exploitation de plateformes de production à haute disponibilité
Analyse de logs et diagnostic d'incidents techniques
Supervision et monitoring
Excellente maîtrise de Grafana : création de dashboards, gestion des métriques et paramétrage des alertes
Expérience des solutions de supervision et de collecte de données telles que :
Prometheus
Centreon
Zabbix
Nagios
ou solutions équivalentes
Automatisation et scripting
Bonnes compétences en Shell, Bash et/ou Python
Automatisation des tâches d'exploitation et des processus de supervision
Infrastructure
Bonne connaissance des protocoles réseau et des architectures systèmes
Compréhension des mécanismes de haute disponibilité, de performance et de résilience
Connaissance des pratiques DevOps et des approches d'industrialisation appréciée
Soft skills :
Fort esprit d'analyse et de résolution de problèmes
Rigueur et sens de l'organisation
Réactivité face aux situations critiques
Capacité à prioriser et à gérer plusieurs sujets simultanément
Esprit d'équipe et aisance dans les échanges avec des interlocuteurs variés
Curiosité technique et volonté d'amélioration continue
Sens du service et de la qualité