Nous attendons une présence sur site deux jours consécutifs tous les quize jours (mercredi/jeudi). Tous les frais sont pris en charges par l'entreprise
Vous avez déjà eu envie de mettre les mains dans le moteur du cloud GPU et de l'IA ? On a un poste qui devrait vous plaire !
Chez Arkane Cloud, on construit un Cloud Service Provider spécialisé dans les infrastructures GPU dédiées à l'IA : instances GPU haute performance, plateforme serverless pour les workloads IA, déploiement et hébergement de modèles en production.
Notre mission
Rendre le déploiement d'applications et de modèles IA radicalement plus simple, pour une communauté d'entrepreneurs, de startups et de développeurs IA.
On est une petite équipe en forte croissance, avec des défis techniques costauds à résoudre au quotidien. On cherche un(e) Machine Learning Engineer expérimenté(e) pour rejoindre l'aventure dès maintenant. Vous arriverez tôt : ce que vous posez aujourd'hui, c'est ce sur quoi toute l'équipe va s'appuyer demain.
Ce que vous ferez
Mise en production & performance d'inférence. Vous déploierez et optimiserez des modèles IA open-source (LLM, VLM, génération d'images et de vidéos) sur notre infra Kubernetes GPU, avec des templates réutilisables et des APIs compatibles OpenAI. Vous tunerez les moteurs d'inférence (vLLM, SGLang, TensorRT-LLM, ComfyUI) pour pousser le débit, réduire la latence et le coût par token.
Benchmark & sizing GPU. Vous concevrez des campagnes de benchmark reproductibles, vous en tirerez des recommandations de sizing GPU et de pricing, documentées pour les équipes produit et commerciale.
Plateforme serverless. Vous contribuerez à notre offre serverless GPU (scale-to-zero, autoscaling, routing, isolation multi-tenant) et à l'expérience développeur autour de nos SDK et APIs.
MLOps & collaboration. Vous automatiserez le cycle de vie des modèles (versioning, tests, observabilité avec Prometheus/Grafana), en lien étroit avec les équipes DevOps et plateforme, et vous accompagnerez nos clients stratégiques sur leurs sujets d'intégration.
Votre profil
5 ans+ d'expérience en Machine Learning Engineering, avec une vraie expérience de mise en production. Vous êtes à l'aise en Python et PyTorch, vous connaissez l'écosystème Hugging Face, et vous avez déjà servi des modèles en prod (vLLM, TensorRT-LLM, SGLang, Triton ou équivalent). Vous maîtrisez Kubernetes et les pipelines CI/CD, et vous comprenez bien le fonctionnement des GPU NVIDIA.
Un plus : de l'expérience sur du serverless/event-driven, du fine-tuning (LoRA, DeepSpeed, FSDP), des contributions open-source, ou une appétence pour les modèles de génération d'images/vidéos.
Pourquoi nous rejoindre
Une infra GPU dernière génération à disposition, des projets qui comptent vraiment pour l'IA de demain, et une petite équipe où votre impact se voit immédiatement. Si l'aventure vous tente, venez en discuter avec nous.
Avantages : Mutuelle à 100%, Tickets Restaurant, RTT.