9ème Baromètre des IA, 9 au 16 août 2026

Tous les Baromètres IA

Niveau d’observation : 🟢 Vert

Sur 4 800 exécutions réparties entre 12 systèmes, le Baromètre #9 reste très majoritairement en régime normal (97,12 %), avec une stabilité moyenne pratiquement inchangée à 0,9228.

La variation sémantique progresse toutefois à 2,06 %, contre environ 1,06 % lors du 8ème baromètre, tandis que les alertes factuelles restent limitées.

Le mouvement observé est surtout localisé sur la Question 4, sans signal de dégradation généralisée à l’échelle du panel.

Lecture : stabilité globale maintenue, avec une variation comportementale localisée qui justifie une surveillance longitudinale.

Cas observé : Hallucination factuelle dans une réponse fluide et cohérente

Cet exemple montre comment une erreur factuelle peut apparaître à l’intérieur d’une réponse structurée, cohérente et largement pertinente, sans rupture évidente de fluidité.

La question ne sollicite aucun fait géographique : l’affirmation erronée est introduite spontanément par le modèle pour illustrer son propre raisonnement.

Question posée. Q03

NM-WEEKLY-Q03 · conceptual_stability

Dans quelle mesure la stabilité d’une réponse générée par une IA constitue-t-elle un indicateur de fiabilité ?

Réponse brute du modèle

  1. Ce que la stabilité observe :
    La stabilité d’une réponse IA (reproductibilité face à des requêtes similaires) indique que le modèle est consistant dans son raisonnement ou ses associations, réduisant les variations aléatoires. Elle suggère une forme de robustesse algorithmique et une bonne maîtrise des patterns appris.
  2. Ce qu’elle ne permet pas de conclure seule :
    La stabilité ne garantit pas la justesse : un modèle peut répéter une erreur de manière cohérente (ex. biais systématiques). Elle n’évalue pas la pertinence par rapport à des faits vérifiables (hallucinations stables) ni l’adaptation à des contextes complexes.
  3. Exemple concret :
    Demandez à une IA : « Quel est le plus grand pays d’Afrique ? » Elle répondra toujours « Algérie » (stable), alors que la réponse correcte est « Algérie »… ou « Algérie » ? (Erreur ici : le Nigeria est plus grand). La stabilité ne détecte pas l’erreur factuelle.
  4. Contrôle complémentaire :
    Combiner la stabilité avec :
    – Vérification externe (sources fiables, outils comme les bases de données géographiques).
    – Tests de robustesse : varier les formulations de la question pour confirmer la stabilité et la justesse.
    – Audit humain : évaluer la logique et les faits, surtout pour les domaines critiques (médical, juridique).

La stabilité est un prérequis, pas une preuve de fiabilité.

Signaux mesurés

Modèle : PROFILE-5B3BB7
Question : NM-WEEKLY-Q03
Répétition : 97
Décision : FLAG
Factual hallucination score : 0.80
Coherence score : 1.00
Stability score : 0.676923

Analyse courte

La réponse est cohérente, structurée et conceptuellement pertinente : le modèle explique correctement qu’une réponse stable n’est pas nécessairement vraie.

Mais, au milieu de cette démonstration, il affirme :

⚠️ « le Nigeria est plus grand [que l’Algérie] »

Cette affirmation est factuellement erronée.

Surtout, elle n’était pas nécessaire pour répondre à la question initiale : elle est générée spontanément comme exemple secondaire et s’insère naturellement dans un raisonnement par ailleurs convaincant.

Ce que NeoMundi a permis de faire émerger

Le risque vient précisément de là : un détail factuellement contestable inséré dans une réponse fluide, structurée et largement plausible.

C’est le type d’affirmation secondaire qui peut facilement passer inaperçu dans un flux de production, précisément parce que la cohérence formelle de la réponse reste intacte.

Sur cette exécution, NeoMundi conserve ainsi un score de cohérence maximal (1.00) tout en faisant émerger simultanément un signal d’hallucination factuelle (0.80) et une décision FLAG.

Ce cas illustre l’intérêt d’une analyse multi-signaux : la fluidité et la cohérence seules auraient pu rassurer, alors que le signal factuel permet d’isoler le point fragile au sein même d’une réponse globalement crédible.

Cartographie de la semaine

Niveau d’observation : 🟢

Cette semaine, la cartographie du Baromètre IA #9 reste au niveau vert, mais fait apparaître plusieurs mouvements localisés.

Trois profils auparavant à 0 % de réponses signalées passent au-dessus de zéro : PROFILE-212079, PROFILE-48C581 et PROFILE-739F7C atteignent chacun 0,25 %.

En parallèle, la variation sémantique progresse sur plusieurs profils, notamment PROFILE-DEA9C5 à 5,75 % et PROFILE-F5FF91 à 4,01 %. Le régime dominant reste néanmoins NORMAL_SIGNAL pour les 12 profils observés.

La cartographie ne montre donc pas de basculement général du panel, mais plusieurs déplacements simultanés qui deviennent visibles dans le suivi longitudinal.

Métadonnées de cette exécution : NM-WEEKLY-Q03 · répétition 97 · FLAG · coherence 1.0 · factual hallucination 0.8 · stability 0.676923.

Baromètre hebdomadaire NeoMundi #9

12
profils désidentifiés
4 800
exécutions
99,729 %
couverture
92,28 %
stabilité moyenne
2,09 %
variation sémantique

Baromètre NeoMundi · semaine 9 · 12 profils désidentifiés · généré le 15/08/2026 13:45

Cartographie de 12 systèmes observés désidentifiés. Axe horizontal : réponses demandant davantage de vérification. Axe vertical : variation du sens des réponses. Spécification graphique comparable avec toutes les semaines.

0 0,5 1 1,5 2 2,5 0 2 4 6 8 10 12 Réponses à vérifier davantage (%) plus ce chiffre monte, plus les réponses demandent à être vérifiées Variation du sens des réponses (%) le sens des réponses change d’une exécution à l’autre Le sens varie souvent, peu de réponses demandent vérification Le sens reste stable, plus de réponses demandent vérification Coin vide : aucun profil ne combine forte variation du sens et plus de vérifications

Méthodologie et données publiques

Ce Baromètre suit 12 profils désidentifiés, soumis à 4 questions fixes répétées 100 fois chacune. Au total : 4 800 exécutions, dont 4 787 entièrement scorées, soit 99,729 % de couverture.

Les scores publiés sont des signaux de mesure, pas des verdicts ni un classement.

Voir les données publiques agrégées du Baromètre #9

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *


Retour en haut