Benchmark · LongMemEval-M · full-haystack
72,9 % en la variante que nadie cita.
Todo el mundo cita LongMemEval. Casi nadie corre el full-haystack: ~480 sesiones distractoras por pregunta — la variante honesta, la más dura. Publicamos la cifra como un suelo, con el protocolo, los fallos, y todo lo necesario para recalcularla tú mismo.
La cifra
~480 sesiones distractoras por pregunta.
La variante honesta. La más dura.
Existe una versión más cómoda de este benchmark. Es la que la industria muestra. Nosotros corrimos la otra, y publicamos la cifra como un suelo: dos categorías nunca se volvieron a jugar con el motor completo, por falta de tiempo de cómputo. Otros modelos quedan también por probar.
Ninguna pregunta se eligió a posteriori. Una sola configuración para todo el mundo. Y un acierto solo cuenta si se reproduce.
Lo que se midió
| Medida | Antes | Después | Δ | Condiciones |
|---|---|---|---|---|
| Full-haystack, 48 q | 64,6 % | 72,9 % | +8,3 | todos los motores |
| Multisesión | 1/8 | 5/8 | +4 | la categoría más dura |
| Ruta real executeQuery, 61 q | 78,7 % | 83,6 % | +4,9 | topK 32 |
| Temporal (A/B inline) | 7/10 | 10/10 | +3 | reproducido ×2 |
| Recall a ~1 M vectores | — | 1.000 | — | MNEMO_ANN |
| 100 % local, cero cloud | — | ~50 % | suelo | Qwen2.5-3B · Vulkan · n=12 · máquina cargada |
La línea «100 % local» merece su precisión: es un suelo, no un techo. Un modelo de tres mil millones de parámetros, sobre doce preguntas, en una máquina ocupada en otra cosa. Los grandes modelos locales de razonamiento, aún no tenemos la potencia para probarlos — así que no sabemos hasta dónde sube, y no lo pretendemos.
Y las palancas que no dieron nada, porque cuentan igual: ledgers de relaciones (peor), pasada maestra (peor), pre-clasificación k-means (nula), barrido de reserva (ruido). Los números primos no portan ninguna señal de memoria — falsado seis veces, enterrado.
La sección que nadie escribe
Lo que fallamos.
En el full-haystack, tres preguntas todavía se resisten. Están descompuestas línea a línea. Aquí están.
×2 — estructural al benchmark
El benchmark apila varios usuarios en una sola memoria. El proyecto de un desconocido se vuelve indistinguible del tuyo en el texto servido. Ningún filtro del lado de la respuesta puede decidir — verificado. Mnemosyne es soberano y monohumano: este modo de fallo no existe en ti. No perseguiremos esos dos puntos.
×1 — nuestra deuda, no nuestro diseño
Un desequilibrio entre lo que escribimos y lo que releemos: un techo de corpus trunca un tema demasiado denso. Es un límite real de ingeniería, tiene un ticket, se corregirá. No lo maquillamos como una elección.
No nos creas sin más
El corrector y los veredictos son públicos. Recalcula.
El corrector publicado y los veredictos por pregunta te dejan re-derivar la puntuación en un comando — sin motor, sin red. La metodología completa, el análisis de causas y los 16 logs en bruto están abiertos también.