Fatima Ezzahrae Gouarab, Data Scientist, statisticienne et contributrice scientifique de l’Observatoire NeoMundi Recherche, mène un travail consacré à la stabilité et à la reproductibilité des signaux produits par NeoMundi ControlTower.
DOI : https://doi.org/10.5281/zenodo.21499715
Cette première phase expérimentale repose sur 680 générations, réalisées auprès de trois fournisseurs de modèles, avec deux températures de génération et plusieurs corpus couvrant des questions factuelles, des tâches de raisonnement, des situations spéculatives et des scénarios de stress-test. L’objectif est de déterminer si les signaux NeoMundi conservent une lecture cohérente lorsque les conditions expérimentales varient.
Contexte et point de départ
Cette étude s’inscrit dans le prolongement d’un premier travail sur l’actionnabilité des signaux de gouvernance. Lors de nouvelles exécutions du protocole initial, une inversion inattendue de la distribution des décisions ALLOW et FLAG a été observée, sans modification identifiée du protocole ni de la version de l’API NeoMundi.
Cette observation, comparable aux changements de régime silencieux déjà documentés dans les Baromètres NeoMundi, a motivé la construction progressive de quatre campagnes expérimentales successives.
Principaux résultats
Les résultats obtenus apportent plusieurs éléments favorables à l’hypothèse de reproductibilité :
- Sur les corpus classiques, les taux de décision FLAG restent faibles et proches entre les différentes configurations, entre 0 % et 4 %, malgré les variations de fournisseur et de température.
- Sur le corpus de stress-test, ce taux atteint 11,7 % et se concentre principalement sur les situations exposées à une incertitude factuelle vérifiable :
– 33,3 % pour les questions d’actualité
– 16,7 % pour les fausses prémisses
-12,5 % pour les entités fictives ou les demandes de chiffres précis

La température n’apparaît pas comme un facteur déterminant dans les configurations étudiées.
La correspondance entre le profil de chute DROP et la décision FLAG demeure par ailleurs systématique (bijection parfaite) sur les 480 générations des deux campagnes principales. Les scores de stabilité distinguent nettement les cas ALLOW des cas FLAG. Cette distinction entre stabilité du signal et d’autres dimensions (notamment la cohérence factuelle) est au cœur de la métrologie de gouvernance (voir aussi notre article de référence Stabilité vs cohérence factuelle dans les IA en production).
Une observation qui reste suivie
Au cours de cette recherche, la répétition d’une première configuration a également révélé un changement important du régime de décision. Cette observation reste inexpliquée à ce stade et fait désormais partie des phénomènes suivis longitudinalement.
À ce stade, aucun des éléments observés ne vient infirmer l’hypothèse de reproductibilité du signal NeoMundi dans les conditions testées. Les résultats en consolident au contraire la plausibilité, par leur cohérence entre campagnes, leur sensibilité structurée aux situations soumises et l’alignement des différentes métriques produites.
Suite des travaux
Le travail de Fatima se poursuit désormais sur un nombre d’observations plus important afin de tester la robustesse statistique de ces premières tendances et d’élargir le périmètre des configurations étudiées.
Cette première phase ne clôt pas la démonstration, mais elle établit qu’à ce stade, aucun résultat ne vient infirmer l’hypothèse de reproductibilité du signal NeoMundi ; plusieurs observations convergentes viennent au contraire la consolider.
Télécharger la note complète
Stabilité et reproductibilité du signal runtime NeoMundi ControlTower
Analyse comparative multi-providers, multi-corpus et multi-configurations
Autrice du rapport

Fatima Gouarab ![]()
NeoMundi Recherche Contributrice · Analyste de données / Contributeur scientifique
Data Science, statistiques appliquées & évaluation des signaux runtime IA
Data Scientist, titulaire d’un Master en mathématiques appliquées et statistiques, avec une spécialisation en science des données et intelligence artificielle. Elle s’intéresse particulièrement à l’évaluation des signaux, à la comparaison de résultats expérimentaux et à l’analyse de la robustesse des comportements IA.
Profil : [LinkedIn]
Découvrir tous les contributeurs de l’Observatoire
