Il est garant de l'accès qualitatif aux sources de données. Il s'assure de la maîtrise de la donnée et est garant de la qualité de son utilisation (référencement, normalisation, et qualification) afin d'en faciliter l'exploitation par les équipes (Data Analysts et Data Scientists). Il contribue également à la définition de la politique de la donnée et à la structuration de son cycle de vie dans le respect des réglementations en vigueur, en collaboration avec le Chief Data Officer. Son périmètre d'intervention est axé sur les systèmes applicatifs autour de la gestion de la donnée et du traitement, et sur les plateformes Big Data, IoT, ?
QUALIFICATION ET GESTION DES DONNÉES :
? Capte les données (structurées et non structurées) produites dans les différentes applications ou à l'extérieur de l'entité
? Intègre les éléments
? Structure la donnée (sémantique, etc.)
? Cartographie les éléments à disposition
? Nettoie la donnée (élimination des doublons, ?)
? Valide la donnée
? Éventuellement, il crée le référentiel de données
Résultat attendu
Le prestataire devra développer un outil dans databricks qui permet de filtrer les clients selon des critères définis par le client.
Il devra livrer une interface permettant d'activer ou désactiver les filtres et produire des rapports sur les clients sélectionnés ce jour.
Il devra développer un ETL en utilisant les services AWS les plus adaptés:
notamment AWS Step Functions pour l'orchestration / moteur de workflow
AWS lambda pour des traitements légers
AWS Aurora ou RDS comme BDD relationnelle transactionnelle
Eventuellement Databricks si besoin d'offload pour des charges de traitements / transformations lourdes
Les données entrantes seront récupérés via des API ou des fichiers plats
Les données sélectionnées et transformées seront envoyées dans une 20aine d'API
Profil candidat:
Expérience significative en Data Engineering dans un environnement cloud
Très bonne maîtrise des environnements Databricks / Spark /Service AWS pour Construction d'ETL
Capacité à travailler dans un environnement agile et industrialisé
Connaissance des enjeux de data governance et qualité
Bonne capacité à documenter et structurer les développements
Esprit collaboratif et orienté delivery
Autonomie
Atouts supplémentaires
Expérience dans le secteur de l'énergie
Avoir déjà construit un ETL
Utilisation des services AWS
Connaissance de Databricks
Expérience sur des programmes de transformation à grande échelle
Connaissance des architectures data modernes (Data Mesh, Data Platform, Lakehouse)
Construction/ modification/améliorer la performance d'API
Expérience en anglais