Benchmark · LongMemEval-M · full-haystack
77,1 % sur la variante que personne ne cite.
Tout le monde cite LongMemEval. Presque personne ne court le full-haystack : ~480 sessions distractrices par question, la variante honnête et la plus dure. 77,1 % au juge strict (37/48, reproduit deux fois, confirmé sur un holdout de 48 questions avec zéro régression de retrieval), 81,3 % sous le juge flexible. Le gain : un second canal de retrieval, entièrement local (BM25 + fusion par rangs). Le récit · la section d'audit.
Le plancher de juillet, 72,9 % au juge flexible, reste documenté en entier plus bas, épinglé à son DOI tel que publié : le protocole, les échecs, et de quoi auditer le score toi-même.
Ce qu'on publie, et ce qu'on retient
LongMemEval-M, variante full-haystack : ~480 sessions distractrices par question. Deux juges différents, donc les deux chiffres se lisent côte à côte et ne s'enchaînent jamais comme une progression.
Juge strict
77,1%
37/48, reproduit deux fois, verdict par verdict
Juge flexible
81,3%
Les mêmes réponses, relues par le juge de juillet
LongMemEval-S
—
La variante facile sur laquelle publie le secteur. Nous, le haystack complet
Les deux chiffres se recalculent depuis les lignes publiées, question par question. Recalcule-les toi-même ↗
LongMemEval-S est la variante facile sur laquelle publie le secteur : 48 sessions de bruit par question au lieu de ~480. On l'a bien lancée, en août, sur un build antérieur au canal lexical et en une seule passe. Ça ne tient pas la règle qu'on applique aux deux chiffres ci-dessus, juge strict et run reproduit, donc la case reste vide plutôt que de porter un chiffre que personne ne pourrait nous opposer.
Le moteur dans le temps
Chaque chiffre, dans l'ordre, chacun avec sa preuve.
13 juil. 2026
64,6 %
Le baseline
Retrieval seul, sans moteur de consolidation. 31/48 au juge flexible. La ligne de départ, chaque verdict publié.
La campagne ↓14–23 juil. 2026
72,9 %
Le moteur de consolidation
Rappel multi-sessions 1/8 → 5/8. Publié comme un plancher composé, pas un plafond, et épinglé à son DOI tel que livré.
La campagne ↓4 août 2026
−31 pts
Le levier refusé
Piloter le retrieval par la personnalité dégrade mesurablement le rappel. La fonctionnalité la plus séduisante de l'année a shippé en costume, pas en pilote.
Le récit →17 août 2026
77,1 %
Le canal lexical, au juge strict
Un second classement, entièrement local, fusionné par rangs. 37/48 au strict, reproduit deux fois, holdout de 48 questions, zéro régression de retrieval. 81,3 % sous le juge flexible de juillet.
Le récit →Suite
—
Une seconde famille de benchmarks
Un benchmark n'est qu'un benchmark. La réserve reste imprimée ici tant qu'une seconde famille n'est pas mesurée.
Le chiffre de chaque tuile se recalcule depuis des lignes par-question publiées. audite-les toi-même ↗.
Vitesse
Ce que coûtent une écriture, et un souvenir.
Mesuré sur une seule machine, un Intel Core Ultra 7 155H, CPU seul, aucun GPU, core-engine 1.2.0, le 2026-08-30. Lancé deux fois ; c'est le run le plus lent qui est affiché. Ce sont nos propres mesures, pas un benchmark jugé comme les scores plus haut.
Écriture
0,10ms
p50 dans le coffre. L'embedding qui la précède n'est pas compté
Rappel vectoriel
20ms
p50, top 10, cache chaud, canal lexical coupé, 10 200 souvenirs
Rappel hybride
108ms
Ce que le chat exécute vraiment : BM25 fusionné au classement
Le rappel hybride est le chemin par défaut depuis le 17 août, celui qui porte le 77,1 % : il classe 200 candidats de profondeur et fusionne une passe BM25 sur les mêmes lignes, donc il coûte 5,3× un rappel vectoriel seul. Les deux répondent depuis le cache chaud en RAM, celui que sert l'application. Pendant que ce cache chauffe, un rappel vectoriel retombe sur un scan complet et coûte 145 ms à cette taille de corpus, et ce repli grandit avec le corpus.
Le chiffre, campagne de juillet
~480 sessions distractrices par question.
La variante honnête. La plus dure.
Il existe une version plus confortable de ce benchmark. C'est celle que l'industrie affiche. Nous avons couru l'autre, et nous publions le chiffre comme un plancher : deux catégories n'ont jamais été rejouées avec le moteur complet, faute de temps de calcul. D'autres modèles restent aussi à tester.
Aucune question n'a été choisie après coup. Une seule configuration pour tout le monde. Et un succès ne compte que s'il se reproduit.
Ce qui a été mesuré
| Mesure | Avant | Après | Δ | Conditions |
|---|---|---|---|---|
| Full-haystack, 48 q | 64,6 % | 72,9 % | +8,3 | tous moteurs |
| Multi-session | 1/8 | 5/8 | +4 | la catégorie la plus dure |
| Chemin de requête réel de l'app, 61 q | 78,7 % | 83,6 % | +4,9 | topK 32 |
| Temporel (A/B inline) | 7/10 | 10/10 | +3 | reproduit ×2 |
| Rappel à ~1 M vecteurs | — | 1.000 | — | MNEMO_ANN |
| 100 % local, zéro cloud | — | ~50 % | plancher | Qwen2.5-3B · Vulkan · n=12 · machine chargée |
La ligne « 100 % local » mérite sa précision : c'est un plancher, pas un plafond. Un modèle de 3 milliards de paramètres, sur douze questions, sur une machine occupée à autre chose. Les gros modèles locaux à raisonnement, nous n'avons pas encore la puissance pour les tester. Nous ne savons donc pas jusqu'où ça monte, et nous ne le prétendons pas.
Et les leviers qui n'ont rien donné, parce qu'ils comptent autant : ledgers de relations (pire), passe master (pire), pré-tri k-means (nul), balayage de réserve (bruit). Les nombres premiers ne portent aucun signal mémoriel. Falsifié six fois, enterré.
La section que personne n'écrit
Ce qu'on rate.
Sur le full-haystack, trois questions résistent encore. Elles sont décomposées à la ligne. Les voici.
×2 · structurel au benchmark
Le benchmark empile plusieurs utilisateurs dans une seule mémoire. Le projet d'un inconnu devient indiscernable du tien dans le texte servi. Aucun filtre côté réponse ne peut trancher, vérifié. Mnemosyne OS est souverain et mono-humain : ce mode d'échec n'existe pas chez toi. Nous ne courrons pas après ces deux points.
×1 · notre dette, pas notre design
Un déséquilibre entre ce qu'on écrit et ce qu'on relit : un plafond de corpus tronque un sujet trop dense. C'est une vraie limite d'ingénierie, elle a un ticket, elle sera corrigée. Nous ne la maquillons pas en choix.
Ne nous crois pas sur parole
Le grader et les verdicts sont publics. Audite-les.
Le correcteur publié et les verdicts par question te laissent re-dériver le score en une commande. Sans moteur, sans réseau. La méthodo complète, l'analyse des causes et les 16 logs bruts sont ouverts aussi.