Mnemosyne OS
Nouveau La documentation est en ligne : chaque moteur, pas à pas. docs.mnemosyne-os.io →

Benchmark · LongMemEval-M · full-haystack

77,1 % sur la variante que personne ne cite.

Tout le monde cite LongMemEval. Presque personne ne court le full-haystack : ~480 sessions distractrices par question, la variante honnête et la plus dure. 77,1 % au juge strict (37/48, reproduit deux fois, confirmé sur un holdout de 48 questions avec zéro régression de retrieval), 81,3 % sous le juge flexible. Le gain : un second canal de retrieval, entièrement local (BM25 + fusion par rangs). Le récit · la section d'audit.

Le plancher de juillet, 72,9 % au juge flexible, reste documenté en entier plus bas, épinglé à son DOI tel que publié : le protocole, les échecs, et de quoi auditer le score toi-même.

Ce qu'on publie, et ce qu'on retient

LongMemEval-M, variante full-haystack : ~480 sessions distractrices par question. Deux juges différents, donc les deux chiffres se lisent côte à côte et ne s'enchaînent jamais comme une progression.

Juge strict

77,1%

37/48, reproduit deux fois, verdict par verdict

Juge flexible

81,3%

Les mêmes réponses, relues par le juge de juillet

LongMemEval-S

La variante facile sur laquelle publie le secteur. Nous, le haystack complet

Les deux chiffres se recalculent depuis les lignes publiées, question par question. Recalcule-les toi-même ↗
LongMemEval-S est la variante facile sur laquelle publie le secteur : 48 sessions de bruit par question au lieu de ~480. On l'a bien lancée, en août, sur un build antérieur au canal lexical et en une seule passe. Ça ne tient pas la règle qu'on applique aux deux chiffres ci-dessus, juge strict et run reproduit, donc la case reste vide plutôt que de porter un chiffre que personne ne pourrait nous opposer.

Vitesse

Ce que coûtent une écriture, et un souvenir.

Mesuré sur une seule machine, un Intel Core Ultra 7 155H, CPU seul, aucun GPU, core-engine 1.2.0, le 2026-08-30. Lancé deux fois ; c'est le run le plus lent qui est affiché. Ce sont nos propres mesures, pas un benchmark jugé comme les scores plus haut.

Écriture

0,10ms

p50 dans le coffre. L'embedding qui la précède n'est pas compté

Rappel vectoriel

20ms

p50, top 10, cache chaud, canal lexical coupé, 10 200 souvenirs

Rappel hybride

108ms

Ce que le chat exécute vraiment : BM25 fusionné au classement

Le rappel hybride est le chemin par défaut depuis le 17 août, celui qui porte le 77,1 % : il classe 200 candidats de profondeur et fusionne une passe BM25 sur les mêmes lignes, donc il coûte 5,3× un rappel vectoriel seul. Les deux répondent depuis le cache chaud en RAM, celui que sert l'application. Pendant que ce cache chauffe, un rappel vectoriel retombe sur un scan complet et coûte 145 ms à cette taille de corpus, et ce repli grandit avec le corpus.

Le chiffre, campagne de juillet

72,9% LongMemEval-M, variante full-haystack :
~480 sessions distractrices par question.
La variante honnête. La plus dure.

Il existe une version plus confortable de ce benchmark. C'est celle que l'industrie affiche. Nous avons couru l'autre, et nous publions le chiffre comme un plancher : deux catégories n'ont jamais été rejouées avec le moteur complet, faute de temps de calcul. D'autres modèles restent aussi à tester.

Aucune question n'a été choisie après coup. Une seule configuration pour tout le monde. Et un succès ne compte que s'il se reproduit.

Ce qui a été mesuré

MesureAvantAprèsΔConditions
Full-haystack, 48 q64,6 %72,9 %+8,3tous moteurs
Multi-session1/85/8+4la catégorie la plus dure
Chemin de requête réel de l'app, 61 q78,7 %83,6 %+4,9topK 32
Temporel (A/B inline)7/1010/10+3reproduit ×2
Rappel à ~1 M vecteurs1.000MNEMO_ANN
100 % local, zéro cloud~50 %plancherQwen2.5-3B · Vulkan · n=12 · machine chargée

La ligne « 100 % local » mérite sa précision : c'est un plancher, pas un plafond. Un modèle de 3 milliards de paramètres, sur douze questions, sur une machine occupée à autre chose. Les gros modèles locaux à raisonnement, nous n'avons pas encore la puissance pour les tester. Nous ne savons donc pas jusqu'où ça monte, et nous ne le prétendons pas.

Et les leviers qui n'ont rien donné, parce qu'ils comptent autant : ledgers de relations (pire), passe master (pire), pré-tri k-means (nul), balayage de réserve (bruit). Les nombres premiers ne portent aucun signal mémoriel. Falsifié six fois, enterré.

La section que personne n'écrit

Ce qu'on rate.

Sur le full-haystack, trois questions résistent encore. Elles sont décomposées à la ligne. Les voici.

×2 · structurel au benchmark

Le benchmark empile plusieurs utilisateurs dans une seule mémoire. Le projet d'un inconnu devient indiscernable du tien dans le texte servi. Aucun filtre côté réponse ne peut trancher, vérifié. Mnemosyne OS est souverain et mono-humain : ce mode d'échec n'existe pas chez toi. Nous ne courrons pas après ces deux points.

×1 · notre dette, pas notre design

Un déséquilibre entre ce qu'on écrit et ce qu'on relit : un plafond de corpus tronque un sujet trop dense. C'est une vraie limite d'ingénierie, elle a un ticket, elle sera corrigée. Nous ne la maquillons pas en choix.

Ne nous crois pas sur parole

Le grader et les verdicts sont publics. Audite-les.

Le correcteur publié et les verdicts par question te laissent re-dériver le score en une commande. Sans moteur, sans réseau. La méthodo complète, l'analyse des causes et les 16 logs bruts sont ouverts aussi.