L’observatoire NeoMundi a soumis Kimi K3 (Moonshot) à un protocole runtime complet :
1 200 exécutions valides – 120 situations répétées 10 fois, réparties dans 12 familles (factualité, raisonnement, gouvernance, médical, juridique, cybersécurité, opérations métier, et plus).
Ce n’est pas un classement.
Ce n’est pas un jugement.
C’est une observation runtime.
L’objectif est de rendre visible ce qui se passe au moment exact où un modèle génère une réponse : stabilité, cohérence, variation sémantique, signaux factuels, latence, volume, densité, et la chaîne de preuve complète derrière chaque signal.
Il s’agit de montrer ce qu’une couche de métrologie runtime permet d’observer au moment même où un système d’IA génère une réponse : sa stabilité, sa cohérence, ses variations, ses signaux factuels, sa latence, son volume de génération et la trace associée.
| Protocole | Résultat |
|---|---|
| Exécutions analysées | 1,200 |
| Couverture finale | 100% |
| Situations distinctes | 120 |
| Répétitions par situation | 10 |
| Familles d’usage | 12 |
1. Un même modèle, plusieurs régimes runtime
Un modèle ne se comporte pas de la même manière face à une question factuelle, une tâche de raisonnement, un prompt ambigu ou une demande métier complexe.
À travers les 12 familles, nous avons observé des différences claires en :
- latence
- longueur des réponses
- densité informationnelle
- profils de stabilité
Une moyenne globale crée l’illusion d’uniformité.
La métrologie runtime montre l’inverse : un même modèle peut fonctionner sous plusieurs régimes distincts.
Pour toute organisation, la vraie question n’est plus « Est-ce que le modèle fonctionne ? »
Elle devient :
Dans quelles conditions son comportement change-t-il, et ces changements sont-ils acceptables pour l’usage prévu ?
2. La stabilité n’est pas la vérité
La stabilité mesure la capacité à produire des sorties comparables lorsque la même situation est répétée.
Mais une réponse très stable peut rester incorrecte, incomplète ou logiquement fragile.
🔔 La stabilité n’équivaut pas à la vérité.
Un modèle peut reproduire exactement la même erreur avec une constance remarquable.
À l’inverse, une variation entre répétitions n’est pas automatiquement un défaut : elle peut être une reformulation légitime ou le signe d’une ambiguïté inhérente.
La mesure doit aider à distinguer :
- une variation normale
- une variation sémantiquement significative
- une réponse stable mais potentiellement incorrecte
- un changement de régime qui mérite investigation
3. La performance ne se résume pas à la vitesse
La latence est utile, mais ce n’est qu’une dimension.
La vraie performance combine :
- temps de réponse
- volume de tokens
- densité informationnelle
- stabilité
- cohérence
- signaux factuels ou sémantiques
- coût et effort runtime
Mesurer uniquement la latence revient à regarder l’infrastructure tout en restant aveugle à la génération elle-même.
La métrologie runtime relie les deux.
4. Un signal n’a de valeur que s’il peut être reconstruit
Un indicateur agrégé peut attirer l’attention.
✔️ Pour devenir actionnable, il doit pouvoir être relié à une observation précise.
Chaque mesure de cette étude est associée à une chaîne de preuve complète :
- prompt et famille
- index de répétition
- modèle demandé et observé
- réponse générée complète
- métriques calculées
- timestamp
- request_id et trace_id
- décision runtime + raisons détaillées
Lorsqu’un signal peut être reconstruit, il devient opérationnel.
Il peut alimenter une investigation, une comparaison longitudinale, une escalade humaine, un reroutage ou une règle de gouvernance.
Ce que démontre cette observation
- Un modèle n’a pas un comportement unique : il traverse différents régimes selon les situations.
- La stabilité doit toujours être lue avec la factualité, la cohérence et la variation sémantique.
- La performance doit combiner vitesse, volume, densité, coût et qualité comportementale.
- Chaque signal doit rester rattaché à une preuve runtime reconstructible.
🎯 NeoMundi n’ajoute pas un dashboard de plus.
Il fournit la couche de mesure manquante entre le comportement du modèle et la décision opérationnelle.
Un signal mesuré n’est pas un verdict.
C’est une nouvelle capacité à observer, comparer, investiguer et gouverner.
Télécharger le rapport technique complet
Rapport d’Observation Runtime
(Rapport PDF Gratuit)

Observatoire NeoMundi · Métrologie Runtime Indépendante
Analyse de 1 200 exécutions sur 12 familles de situations
Moonshot Kimi K3 – 22 juillet 2026
