Plateforme On-Premise & Cloud
Synthèse de la Mission : Rôle : Ingénieur Data Senior ( > 7 ans d'expérience)
Localisation : Paris ou Rennes (3 jours/semaine sur site, 2 jours en télétravail)
TJM Max : 770 ? / jour
Date de démarrage : ASAP
Durée : 5 à 6 mois (jusqu'au 27/11/2026)
Contexte & Objectif de la Mission : Au sein d'un grand groupe média, l'objectif principal est de concevoir et construire le MVP d'une plateforme Data On-Premise basée sur des technologies Open Source.
La plateforme permettra de :
Gérer les transformations de données On-Premise et alimenter un Data Lake local.
Servir de plateforme d'ingestion pour le Big Data sur GCP (Cloud Public).
Faciliter la transition du mode Batch vers le Streaming (Temps réel).
Valider la faisabilité de migration de flux ETL legacy (OpenText / Genio).
Responsabilités & Missions Principales : Conception & Déploiement du MVP :
Architecturer et intégrer la plateforme sur un socle existant (Kubernetes, GitLab CI, Prometheus/OpenTelemetry).
Installer et configurer la stack Open Source : Kafka, NiFi, Spark, Iceberg, Trino.
Validation Technique & Cas d'Usage :
Migrer quelques flux ETL clés pour valider la valeur de la plateforme.
Déployer des pipelines streaming (Kafka + Spark Structured Streaming).
Mettre en place l'alimentation du Data Lake (Iceberg + Trino) et assurer l'interopérabilité avec GCP.
Collaboration & Documentation :
Travailler en synergie avec les équipes Data/IA et DevOps/Infra.
Documenter l'architecture, les choix techniques et transmettre les compétences aux équipes internes.
Profil candidat:
Stack Technique & Compétences Requises : Écosystème Data / Open Source : Apache Kafka, Apache NiFi, Apache Spark, Apache Iceberg, Trino.
Environnement Cloud & Infra : GCP, Kubernetes, GitLab CI, Prometheus / OpenTelemetry.
Problématiques : Streaming temps réel, Data Lake On-Premise, migration ETL.
Expérience : > 5 ans en ingénierie de données complexes.