AI Infrastructure Engineer - Inference, Serving, Training & Data de production H/F/N
Concevoir, déployer et opérer notre plateforme d’inférence interne (vLLM, Triton, autoscaling, batching, multi-tenancy, haute disponibilité)
Optimiser la latence, le débit et le coût de l’inférence (quantization, placement des modèles, dimensionnement des ressources GPU)
Assurer l’exploitation des workloads de training et de fine-tuning sur le socle de calcul opéré par l’équipe
Porter la continuité de la chaîne training vers inférence en industrialisant le passage du checkpoint au modèle servi en production
Être responsable des données du cycle de vie des modèles (registre, versioning, traçabilité dataset-entraînement-modèle-déploiement)
Être responsable des données de production de l’inférence (logging, anonymisation, rétention) Mettre à disposition les données de feedback pour le réentraînement et le fine-tuning des modèles
Définir avec les équipes clientes les standards de mise en production des modèles
Participer à l’astreinte, rédiger les runbooks, contribuer aux post-mortems et automatiser la remédiation
Remettre constamment en question ce qui existe et explorer ce qui doit évoluer pour répondre aux besoins internes Appliquer les aspects de sécurité matériel, logiciel et data sur toute la chaîne de valeur
Travailler en étroite collaboration avec les équipes OVHcloud France et à l’International