En tant que stagiaire au sein de l'unité S.AI.R (IA et traitement des données), vous travaillerez en étroite collaboration avec des ingénieurs recherche pour améliorer les capacités de raisonnement des LLMs ou de systèmes agentiques sur des données internes et publiques. L'objectif principal du stage sera d'étendre les capacités de raisonnement multi-hop des LLMs. Ce type de raisonnement consiste à formuler une conclusion à travers une succession d'étapes logiques, où chaque étape s'appuie sur des informations ou des concepts intermédiaires pouvant provenir de différentes sources [1,2]. Pour atteindre cet objectif le candidat sera amené à explorer différents axes de recherche possibles tels que l'apprentissage par renforcement, le latent reasoning [3, 4], le causal learning [5,6], ou encore des méthodes de raisonnement fondées sur la création et l'exploitation de graphes de connaissance (représentant la mémoire de l'agent ou une base de données externes) [7]. L'étude pourra également s'appuyer sur les capacités de programmation des LLMs [8]. Ce stage allie à la fois des aspects informatiques (programmation) et des aspects mathématiques liés aux LLMs, et il pourra se poursuivre par une thèse CIFRE.
Vos missions pendant le stage consisteront à :
- Conduire des recherches pour améliorer les capacités de raisonnement multi-hop des LLMs.
- Réaliser une recherche bibliographique.
- Implémenter et tester les différentes approches identifiées sur des cas d'usages spécifiques (publics et internes).
- Développer de nouvelles stratégies pour améliorer les capacités de raisonnement multi-hop des LLMs.
- Publier les résultats de recherche dans des journaux/conférences (NeurIPS, ICLR, ICML, ACL, COLM).
Bibliographie :
[1] Yang, Zhilin, et al. "HotpotQA: A dataset for diverse, explainable multi-hop question answering." 2018.
[2] Schnitzler, Julian, et al. "Morehopqa: More than multi-hop reasoning." arXiv preprint arXiv:2406.13397 (2024).
[3] Chen, Xinghao, et al. "Reasoning beyond language: A comprehensive survey on latent chain-of-thought reasoning." arXiv preprint arXiv:2505.16782 (2025).
[4] Yang, Sohee, et al. "Do large language models latently perform multi-hop reasoning?." 2024.
[5] Schölkopf, Bernhard. "Causality for machine learning." Probabilistic and causal inference: The works of Judea Pearl. 2022. 765-804.
[6] Jin, Zhijing. "Causality for natural language processing." arXiv preprint arXiv:2504.14530 (2025).
[7] Chen, Ruirui, et al. "LLM-based multi-hop question answering with knowledge graph integration in evolving environments." EMNLP 2024.
[8] Zhang, Alex L., Tim Kraska, and Omar Khattab. "Recursive language models." arXiv preprint arXiv:2512.24601 (2025).