Les plateformes dédiées à l'expérimentation comme Grid'5000 [1] et Chameleon [2] ont largement prouvé leur capacité à supporter la réalisation reproductibles d'expériences d'envergure pour les systèmes distribués (Cloud, HPC et Continum). Néanmoins il est à noter que de nombreuses difficultés demeurent que cela soit dans leurs usages et leurs exploitations.
Pour les usages, c'est-à-dire la réalisation et la conduite d'expériences, nous avons identifié [3] des classes de difficulté, ou frictions, qui apparaissent naturellement dans la répétition des expériences et l'évolution des besoins qui se traduisent généralement dans une montée en complexité difficile à maîtriser. Ces frictions impliquent de réanalyser et le cas échéant faire évoluer les méthodes et outils de conduites d'expériences voire d'introduire de nouvelles abstractions pour garder une bonne maîtrise du déroulé expérimental.
Pour les difficultés associées à l'exploitation de ce type de plateformes, c'est un sujet qui reste peu étudié. Une plateforme comme Grid'5000 est un objet complexe il en va de même des plateformes de moindre envergure. En première analyse il apparaît que mettre en place une plateforme pour l'expérimentation représente un effort conséquent. Ce point est problématique car de nombreuses équipes de recherches amorcent des études expérimentales en composant des plateformes d'expérimentation autours d'équipement spécifiques sans maîtriser les méthodes et services nécessaires pour un accès partager et un contrôle propre des processus expérimentaux. Cela conduite généralement soit à des limitations soit à une augmentation des frictions dans leurs usages. La qualité des résultats expérimentaux et leurs analyses peut alors en être directement impactée.
Dans cette thèse, nous nous intéressons à traiter ces 2 axes précédents en considérer l'usage de l'approche par Functional Package Manager (FPM) [4].
Il s'agit notamment de profiter de leur garantie de reproductibilité et de leur capacité de composabilité. Dans [5] nous avons montrer que leur usage est particulièrement pertinent pour exprimer des piles logicielles complexes de systèmes distribués à des fins d'expérimentation, ici les objets directs d'études ne seront plus des expériences de systèmes distribués mais les plates-formes dédiées à l'expérimentation.
References:
[1] Bolze, Raphaël, et al. "Grid'5000: a large scale and highly reconfigurable experimental grid testbed." The International Journal of High Performance Computing Applications 20.4 (2006): 481-494.
[2] Keahey, Kate, et al. "Lessons learned from the chameleon testbed." 2020 USENIX annual technical conference (USENIX ATC 20). 2020.
[3] Amine Salmane; Yifei Sun; Hugo Brunie and Olivier Richard "Some Lessons learnt on FPM promises with NixOS-Compose."
2026 1ˢᵗ Workshop in Sustainable Practices for Reproducibility in HPC, ISC26 - 2026.
[4] Dolstra, Eelco. The purely functional software deployment model. Utrecht University, 2006.
[5] Guilloteau, Quentin, et al. "Painless transposition of reproducible distributed environments with nixos compose." 2022 IEEE International Conference on Cluster Computing (CLUSTER). IEEE, 2022. Xiaohua Zhai et al., Scaling Vision Transformers, IEEE/CVF CVPR, 2022