Activités principales
1. Extension des benchmarks existants
La personne recrutée contribuera à l’extension des benchmarks utilisés pour évaluer la conformité logique des modèles prédictifs. Les travaux attendus incluent :
— identifier et sélectionner des jeux de données relationnels adaptés à l’évaluation de modèles prédictifs sous contraintes;
— formaliser, pour chaque jeu de données, un ensemble de règles logiques pertinentes : contraintes d’intégrité, règles temporelles, règles métier, règles de cohérence inter-tables, règles de monotonie ou d’exclusion;
— adapter les jeux de données existants afin de produire des tâches prédictives standardisées;
— définir des protocoles d’évaluation reproductibles combinant métriques prédictives classiques et métriques de conformité logique;
— produire des scripts de préparation, documentation et configuration permettant l’ajout de nouveaux benchmarks.
2. Développement d’un cadre d’évaluation ex-post et ex-ante
Le coeur du poste consistera à concevoir un cadre logiciel modulaire permettant d’évaluer la métrique de conformité logique selon plusieurs niveaux d’information disponibles sur le modèle :
— évaluation à partir de prédictions stockées dans une base relationnelle;
— évaluation à partir d’un modèle entraîné accessible comme boîte noire;
— évaluation à partir d’un modèle accessible comme boîte blanche ou partiellement interprétable;
— évaluation à partir d’un schéma relationnel, d’un espace de prédictions et de règles logiques, sans
nécessairement disposer des données d’entraînement;
— génération automatique ou semi-automatique de requêtes d’évaluation, par exemple sous forme SQL,
Datalog ou logique du premier ordre restreinte.
Le cadre devra être conçu pour être extensible à différents types de règles, différents formats de
données et différents modèles prédictifs. Une attention particulière sera portée à la robustesse logicielle,
à la reproductibilité des expériences et à la clarté de l’API.
3. Benchmark pour le relational learning neurosymbolique
Un axe important du poste portera sur la réalisation d’un benchmark d’évaluation pour le relational
learning neurosymbolique, en s’appuyant notamment sur RelBench et sur des bases relationnelles réelles.
Les cas d’étude envisagés incluent :
— des jeux de données de type MIMIC,enrichis par des règles médicales, temporelles ou de cohérence clinique;
— des données de type DVF/DV3F ou données foncières, enrichies par des règles géographiques, fiscales, administratives ou de cohérence transactionnelle ou vis-à-vis de plans locaux d’urbanisme;
— des jeux de données issus de data.gouv.fr, notamment repérés à travers des initiatives comme DGML (DINUM), afin d’explorer des cas d’usage publics, réglementaires ou administratifs;
— des tâches RelBench existantes ou adaptées, complétées par des règles logiques explicites permettant d’évaluer non seulement la performance prédictive, mais aussi la conformité des prédictions.
Ce benchmark devra permettre de comparer plusieurs familles de modèles : modèles tabulaires clas-
siques, modèles relationnels, modèles de graphes, architectures de relational deep learning, approches
neuro-symboliques et méthodes intégrant explicitement des contraintes logiques.