Positionné au sein de la DSI de l'entreprise, le Data Engineer intègrera l'équipe Conso Data qui traite les données de consommation des clients afin de les exposer sur les canaux digitaux.
Il devra :
- Être force de proposition et participer à la conception des solutions techniques en collaboration avec les membres de l'équipe.
- Comprendre les enjeux métiers afin de concevoir des solutions répondant aux besoins fonctionnels.
- Participer aux cérémonies Agile SAFe (PI Planning, macro-chiffrage, refinements, rétrospectives, etc.).
- Concevoir et faire évoluer les architectures de données basées sur l'approche Databricks Medallion Architecture (Bronze, Silver, Gold).
- Garantir la qualité, la fiabilité et la performance des traitements de données en production. (Jobs Databricks et APIs)
- Contribuer à l'amélioration continue de la plateforme en proposant des optimisations techniques, des bonnes pratiques et des innovations.
Il sera notamment amené à :
- Concevoir, développer et maintenir des pipelines de données (ETL) pour les flux d'intégration et les flux métiers.
- Mettre en ?uvre et orchestrer les traitements de données à l'aide des outils Databricks.
- Modéliser les données dans les tables Delta Lake en appliquant les bonnes pratiques de partitionnement, indexation, optimisation et gouvernance.
- Optimiser les performances des traitements Databricks (Spark, Delta Lake, gestion des coûts et du temps d'exécution).
- Assurer le développement, les tests et le déploiement des composants techniques via des processus CI/CD.
- Concevoir, développer et maintenir des APIs permettant l'exposition et la consommation des données.
- Mettre en place des mécanismes de contrôle qualité des données (Data Quality), de monitoring et d'alerting.
- Identifier, analyser et résoudre les incidents de production tout en assurant le suivi des actions correctives.
- Rédiger et maintenir la documentation technique des solutions mises en ?uvre.
- Accompagner les équipes dans l'adoption des bonnes pratiques Data Engineering
Environnement Technique :
- Python, SQL
- Spark, PySpark, DBUtils
- FastApi, Pytest
- Databricks, Unity Catalog
- Ariflow (migration vers Databricks Workflow)
- AWS (Lambda, secrect manager, Bucket S3, ECS)
- Git et gestion du versioning
- Déploiement pipeline CI/CD
Profil candidat:
Compétences à évaluer
- Conception et developpement de pipelines de données
- Connaissance des principes d'API REST et des architectures orientées services.
- Solides connaissances en modélisation de données, performance et qualité des données.
- Analyses & correction d'anomalies
- Connaissance Cloud AWS
- Maîtrise de Python, SQL et des bibliothèques d'analyse de données (DButils, PySpark, Boto3)
- Maitrise des configurations ressources Databricks AWS
- Expérience de Techlead
- La gestion de streaming de données en temps réel serait un plus