Benchmark · LongMemEval-M · full-haystack
72,9 % sur la variante que personne ne cite.
Tout le monde cite LongMemEval. Presque personne ne court le full-haystack : ~480 sessions distractrices par question — la variante honnête, la plus dure. On publie le chiffre comme un plancher, avec le protocole, les échecs, et de quoi le recalculer toi-même.
Le chiffre
~480 sessions distractrices par question.
La variante honnête. La plus dure.
Il existe une version plus confortable de ce benchmark. C'est celle que l'industrie affiche. Nous avons couru l'autre, et nous publions le chiffre comme un plancher : deux catégories n'ont jamais été rejouées avec le moteur complet, faute de temps de calcul. D'autres modèles restent aussi à tester.
Aucune question n'a été choisie après coup. Une seule configuration pour tout le monde. Et un succès ne compte que s'il se reproduit.
Ce qui a été mesuré
| Mesure | Avant | Après | Δ | Conditions |
|---|---|---|---|---|
| Full-haystack, 48 q | 64,6 % | 72,9 % | +8,3 | tous moteurs |
| Multi-session | 1/8 | 5/8 | +4 | la catégorie la plus dure |
| Chemin réel executeQuery, 61 q | 78,7 % | 83,6 % | +4,9 | topK 32 |
| Temporel (A/B inline) | 7/10 | 10/10 | +3 | reproduit ×2 |
| Rappel à ~1 M vecteurs | — | 1.000 | — | MNEMO_ANN |
| 100 % local, zéro cloud | — | ~50 % | plancher | Qwen2.5-3B · Vulkan · n=12 · machine chargée |
La ligne « 100 % local » mérite sa précision : c'est un plancher, pas un plafond. Un modèle de 3 milliards de paramètres, sur douze questions, sur une machine occupée à autre chose. Les gros modèles locaux à raisonnement, nous n'avons pas encore la puissance pour les tester — donc nous ne savons pas jusqu'où ça monte, et nous ne le prétendons pas.
Et les leviers qui n'ont rien donné, parce qu'ils comptent autant : ledgers de relations (pire), passe master (pire), pré-tri k-means (nul), balayage de réserve (bruit). Les nombres premiers ne portent aucun signal mémoriel — falsifié six fois, enterré.
La section que personne n'écrit
Ce qu'on rate.
Sur le full-haystack, trois questions résistent encore. Elles sont décomposées à la ligne. Les voici.
×2 — structurel au benchmark
Le benchmark empile plusieurs utilisateurs dans une seule mémoire. Le projet d'un inconnu devient indiscernable du tien dans le texte servi. Aucun filtre côté réponse ne peut trancher — vérifié. Mnemosyne est souverain et mono-humain : ce mode d'échec n'existe pas chez toi. Nous ne courrons pas après ces deux points.
×1 — notre dette, pas notre design
Un déséquilibre entre ce qu'on écrit et ce qu'on relit : un plafond de corpus tronque un sujet trop dense. C'est une vraie limite d'ingénierie, elle a un ticket, elle sera corrigée. Nous ne la maquillons pas en choix.
Ne nous crois pas sur parole
Le grader et les verdicts sont publics. Recalcule.
Le correcteur publié et les verdicts par question te laissent re-dériver le score en une commande — sans moteur, sans réseau. La méthodo complète, l'analyse des causes et les 16 logs bruts sont ouverts aussi.