Benchmark · LongMemEval-M · full-haystack
77,1 % en la variante que nadie cita.
Todo el mundo cita LongMemEval. Casi nadie corre el full-haystack: ~480 sesiones distractoras por pregunta, la variante honesta y la más dura. 77,1 % con juez estricto (37/48, reproducido dos veces, confirmado sobre un holdout de 48 preguntas con cero regresiones de retrieval), 81,3 % bajo el juez flexible. La ganancia: un segundo canal de retrieval, totalmente local (BM25 + fusión por rangos). La historia · la sección de auditoría.
El suelo de julio, 72,9 % con juez flexible, sigue documentado por completo más abajo, fijado a su DOI tal como se publicó: el protocolo, los fallos, y todo lo necesario para auditar la puntuación tú mismo.
Lo que publicamos, y lo que retenemos
LongMemEval-M, variante full-haystack: ~480 sesiones distractoras por pregunta. Dos jueces distintos, así que las dos cifras se leen una al lado de otra y nunca se encadenan como una progresión.
Juez estricto
77,1%
37/48, reproducido dos veces, veredicto por veredicto
Juez flexible
81,3%
Las mismas respuestas, releídas por el juez de julio
LongMemEval-S
—
La variante fácil sobre la que publica el sector. Nosotros, el haystack completo
Ambas cifras se recalculan desde las filas publicadas, pregunta por pregunta. Recalcúlalas tú mismo ↗
LongMemEval-S es la variante fácil sobre la que publica el sector: 48 sesiones de ruido por pregunta en vez de ~480. Sí la ejecutamos, en agosto, sobre un build anterior al canal léxico y en una sola pasada. Eso no cumple la regla que aplicamos a las dos cifras de arriba, juez estricto y corrida reproducida, así que la casilla queda vacía en lugar de llevar una cifra que nadie podría exigirnos.
El motor en el tiempo
Cada cifra, en orden, cada una con su prueba.
13 jul. 2026
64,6 %
El baseline
Solo retrieval, sin motor de consolidación. 31/48 con juez flexible. La línea de salida, cada veredicto publicado.
La campaña ↓14–23 jul. 2026
72,9 %
El motor de consolidación
Recuerdo multisesión 1/8 → 5/8. Publicado como suelo compuesto, no techo, y fijado a su DOI tal como se entregó.
La campaña ↓4 ago. 2026
−31 pts
La palanca rechazada
Dirigir el retrieval por la personalidad degrada mediblemente el recuerdo. La función más seductora del año se entregó como disfraz, no como piloto.
La historia →17 ago. 2026
77,1 %
El canal léxico, con juez estricto
Un segundo ranking, totalmente local, fusionado por rangos. 37/48 en estricto, reproducido dos veces, holdout de 48 preguntas, cero regresiones de retrieval. 81,3 % bajo el juez flexible de julio.
La historia →Siguiente
—
Una segunda familia de benchmarks
Un benchmark es solo un benchmark. La reserva queda impresa aquí hasta que se mida una segunda familia.
La cifra de cada ficha se recalcula desde filas por-pregunta publicadas. audítalas tú mismo ↗.
Velocidad
Lo que cuesta escribir, y recordar.
Medido en una sola máquina, un Intel Core Ultra 7 155H, solo CPU, sin GPU, core-engine 1.2.0, el 2026-08-30. Ejecutado dos veces; se muestra la corrida más lenta. Son nuestras propias mediciones, no un benchmark juzgado como las puntuaciones de arriba.
Escritura
0,10ms
p50 en la bóveda. El embedding que la precede no se cuenta
Recuperación vectorial
20ms
p50, top 10, caché caliente, canal léxico apagado, 10.200 recuerdos
Recuperación híbrida
108ms
Lo que el chat ejecuta de verdad: BM25 fusionado al ranking
La recuperación híbrida es el camino por defecto desde el 17 de agosto, el que sostiene el 77,1 %: ordena 200 candidatos de profundidad y fusiona una pasada BM25 sobre las mismas filas, así que cuesta 5,3× una recuperación solo vectorial. Ambas responden desde la caché caliente en RAM, la que sirve la aplicación. Mientras esa caché se calienta, una recuperación vectorial cae a un escaneo completo y cuesta 145 ms con este tamaño de corpus, y ese repliegue crece con el corpus.
La cifra, campaña de julio
~480 sesiones distractoras por pregunta.
La variante honesta. La más dura.
Existe una versión más cómoda de este benchmark. Es la que la industria muestra. Nosotros corrimos la otra, y publicamos la cifra como un suelo: dos categorías nunca se volvieron a jugar con el motor completo, por falta de tiempo de cómputo. Otros modelos quedan también por probar.
Ninguna pregunta se eligió a posteriori. Una sola configuración para todo el mundo. Y un acierto solo cuenta si se reproduce.
Lo que se midió
| Medida | Antes | Después | Δ | Condiciones |
|---|---|---|---|---|
| Full-haystack, 48 q | 64,6 % | 72,9 % | +8,3 | todos los motores |
| Multisesión | 1/8 | 5/8 | +4 | la categoría más dura |
| Ruta de consulta real de la app, 61 q | 78,7 % | 83,6 % | +4,9 | topK 32 |
| Temporal (A/B inline) | 7/10 | 10/10 | +3 | reproducido ×2 |
| Recall a ~1 M vectores | — | 1.000 | — | MNEMO_ANN |
| 100 % local, cero cloud | — | ~50 % | suelo | Qwen2.5-3B · Vulkan · n=12 · máquina cargada |
La línea «100 % local» merece su precisión: es un suelo, no un techo. Un modelo de tres mil millones de parámetros, sobre doce preguntas, en una máquina ocupada en otra cosa. Los grandes modelos locales de razonamiento, aún no tenemos la potencia para probarlos. Así que no sabemos hasta dónde sube, y no lo pretendemos.
Y las palancas que no dieron nada, porque cuentan igual: ledgers de relaciones (peor), pasada maestra (peor), pre-clasificación k-means (nula), barrido de reserva (ruido). Los números primos no portan ninguna señal de memoria. Falsado seis veces, enterrado.
La sección que nadie escribe
Lo que fallamos.
En el full-haystack, tres preguntas todavía se resisten. Están descompuestas línea a línea. Aquí están.
×2 · estructural al benchmark
El benchmark apila varios usuarios en una sola memoria. El proyecto de un desconocido se vuelve indistinguible del tuyo en el texto servido. Ningún filtro del lado de la respuesta puede decidir, verificado. Mnemosyne OS es soberano y monohumano: este modo de fallo no existe en ti. No perseguiremos esos dos puntos.
×1 · nuestra deuda, no nuestro diseño
Un desequilibrio entre lo que escribimos y lo que releemos: un techo de corpus trunca un tema demasiado denso. Es un límite real de ingeniería, tiene un ticket, se corregirá. No lo maquillamos como una elección.
No nos creas sin más
El corrector y los veredictos son públicos. Audítalos.
El corrector publicado y los veredictos por pregunta te dejan re-derivar la puntuación en un comando. Sin motor, sin red. La metodología completa, el análisis de causas y los 16 logs en bruto están abiertos también.