Mnemosyne OS

Benchmark · LongMemEval-M · full-haystack

72,9 % sur la variante que personne ne cite.

Tout le monde cite LongMemEval. Presque personne ne court le full-haystack : ~480 sessions distractrices par question — la variante honnête, la plus dure. On publie le chiffre comme un plancher, avec le protocole, les échecs, et de quoi le recalculer toi-même.

Le chiffre

72,9% LongMemEval-M, variante full-haystack :
~480 sessions distractrices par question.
La variante honnête. La plus dure.

Il existe une version plus confortable de ce benchmark. C'est celle que l'industrie affiche. Nous avons couru l'autre, et nous publions le chiffre comme un plancher : deux catégories n'ont jamais été rejouées avec le moteur complet, faute de temps de calcul. D'autres modèles restent aussi à tester.

Aucune question n'a été choisie après coup. Une seule configuration pour tout le monde. Et un succès ne compte que s'il se reproduit.

Ce qui a été mesuré

MesureAvantAprèsΔConditions
Full-haystack, 48 q64,6 %72,9 %+8,3tous moteurs
Multi-session1/85/8+4la catégorie la plus dure
Chemin réel executeQuery, 61 q78,7 %83,6 %+4,9topK 32
Temporel (A/B inline)7/1010/10+3reproduit ×2
Rappel à ~1 M vecteurs1.000MNEMO_ANN
100 % local, zéro cloud~50 %plancherQwen2.5-3B · Vulkan · n=12 · machine chargée

La ligne « 100 % local » mérite sa précision : c'est un plancher, pas un plafond. Un modèle de 3 milliards de paramètres, sur douze questions, sur une machine occupée à autre chose. Les gros modèles locaux à raisonnement, nous n'avons pas encore la puissance pour les tester — donc nous ne savons pas jusqu'où ça monte, et nous ne le prétendons pas.

Et les leviers qui n'ont rien donné, parce qu'ils comptent autant : ledgers de relations (pire), passe master (pire), pré-tri k-means (nul), balayage de réserve (bruit). Les nombres premiers ne portent aucun signal mémoriel — falsifié six fois, enterré.

La section que personne n'écrit

Ce qu'on rate.

Sur le full-haystack, trois questions résistent encore. Elles sont décomposées à la ligne. Les voici.

×2 — structurel au benchmark

Le benchmark empile plusieurs utilisateurs dans une seule mémoire. Le projet d'un inconnu devient indiscernable du tien dans le texte servi. Aucun filtre côté réponse ne peut trancher — vérifié. Mnemosyne est souverain et mono-humain : ce mode d'échec n'existe pas chez toi. Nous ne courrons pas après ces deux points.

×1 — notre dette, pas notre design

Un déséquilibre entre ce qu'on écrit et ce qu'on relit : un plafond de corpus tronque un sujet trop dense. C'est une vraie limite d'ingénierie, elle a un ticket, elle sera corrigée. Nous ne la maquillons pas en choix.

Ne nous crois pas sur parole

Le grader et les verdicts sont publics. Recalcule.

Le correcteur publié et les verdicts par question te laissent re-dériver le score en une commande — sans moteur, sans réseau. La méthodo complète, l'analyse des causes et les 16 logs bruts sont ouverts aussi.