Mnemosyne OS
Nuevo La documentación está en línea: cada motor, paso a paso. docs.mnemosyne-os.io →

Benchmark · LongMemEval-M · full-haystack

77,1 % en la variante que nadie cita.

Todo el mundo cita LongMemEval. Casi nadie corre el full-haystack: ~480 sesiones distractoras por pregunta, la variante honesta y la más dura. 77,1 % con juez estricto (37/48, reproducido dos veces, confirmado sobre un holdout de 48 preguntas con cero regresiones de retrieval), 81,3 % bajo el juez flexible. La ganancia: un segundo canal de retrieval, totalmente local (BM25 + fusión por rangos). La historia · la sección de auditoría.

El suelo de julio, 72,9 % con juez flexible, sigue documentado por completo más abajo, fijado a su DOI tal como se publicó: el protocolo, los fallos, y todo lo necesario para auditar la puntuación tú mismo.

Lo que publicamos, y lo que retenemos

LongMemEval-M, variante full-haystack: ~480 sesiones distractoras por pregunta. Dos jueces distintos, así que las dos cifras se leen una al lado de otra y nunca se encadenan como una progresión.

Juez estricto

77,1%

37/48, reproducido dos veces, veredicto por veredicto

Juez flexible

81,3%

Las mismas respuestas, releídas por el juez de julio

LongMemEval-S

La variante fácil sobre la que publica el sector. Nosotros, el haystack completo

Ambas cifras se recalculan desde las filas publicadas, pregunta por pregunta. Recalcúlalas tú mismo ↗
LongMemEval-S es la variante fácil sobre la que publica el sector: 48 sesiones de ruido por pregunta en vez de ~480. Sí la ejecutamos, en agosto, sobre un build anterior al canal léxico y en una sola pasada. Eso no cumple la regla que aplicamos a las dos cifras de arriba, juez estricto y corrida reproducida, así que la casilla queda vacía en lugar de llevar una cifra que nadie podría exigirnos.

Velocidad

Lo que cuesta escribir, y recordar.

Medido en una sola máquina, un Intel Core Ultra 7 155H, solo CPU, sin GPU, core-engine 1.2.0, el 2026-08-30. Ejecutado dos veces; se muestra la corrida más lenta. Son nuestras propias mediciones, no un benchmark juzgado como las puntuaciones de arriba.

Escritura

0,10ms

p50 en la bóveda. El embedding que la precede no se cuenta

Recuperación vectorial

20ms

p50, top 10, caché caliente, canal léxico apagado, 10.200 recuerdos

Recuperación híbrida

108ms

Lo que el chat ejecuta de verdad: BM25 fusionado al ranking

La recuperación híbrida es el camino por defecto desde el 17 de agosto, el que sostiene el 77,1 %: ordena 200 candidatos de profundidad y fusiona una pasada BM25 sobre las mismas filas, así que cuesta 5,3× una recuperación solo vectorial. Ambas responden desde la caché caliente en RAM, la que sirve la aplicación. Mientras esa caché se calienta, una recuperación vectorial cae a un escaneo completo y cuesta 145 ms con este tamaño de corpus, y ese repliegue crece con el corpus.

La cifra, campaña de julio

72,9% LongMemEval-M, variante full-haystack:
~480 sesiones distractoras por pregunta.
La variante honesta. La más dura.

Existe una versión más cómoda de este benchmark. Es la que la industria muestra. Nosotros corrimos la otra, y publicamos la cifra como un suelo: dos categorías nunca se volvieron a jugar con el motor completo, por falta de tiempo de cómputo. Otros modelos quedan también por probar.

Ninguna pregunta se eligió a posteriori. Una sola configuración para todo el mundo. Y un acierto solo cuenta si se reproduce.

Lo que se midió

MedidaAntesDespuésΔCondiciones
Full-haystack, 48 q64,6 %72,9 %+8,3todos los motores
Multisesión1/85/8+4la categoría más dura
Ruta de consulta real de la app, 61 q78,7 %83,6 %+4,9topK 32
Temporal (A/B inline)7/1010/10+3reproducido ×2
Recall a ~1 M vectores1.000MNEMO_ANN
100 % local, cero cloud~50 %sueloQwen2.5-3B · Vulkan · n=12 · máquina cargada

La línea «100 % local» merece su precisión: es un suelo, no un techo. Un modelo de tres mil millones de parámetros, sobre doce preguntas, en una máquina ocupada en otra cosa. Los grandes modelos locales de razonamiento, aún no tenemos la potencia para probarlos. Así que no sabemos hasta dónde sube, y no lo pretendemos.

Y las palancas que no dieron nada, porque cuentan igual: ledgers de relaciones (peor), pasada maestra (peor), pre-clasificación k-means (nula), barrido de reserva (ruido). Los números primos no portan ninguna señal de memoria. Falsado seis veces, enterrado.

La sección que nadie escribe

Lo que fallamos.

En el full-haystack, tres preguntas todavía se resisten. Están descompuestas línea a línea. Aquí están.

×2 · estructural al benchmark

El benchmark apila varios usuarios en una sola memoria. El proyecto de un desconocido se vuelve indistinguible del tuyo en el texto servido. Ningún filtro del lado de la respuesta puede decidir, verificado. Mnemosyne OS es soberano y monohumano: este modo de fallo no existe en ti. No perseguiremos esos dos puntos.

×1 · nuestra deuda, no nuestro diseño

Un desequilibrio entre lo que escribimos y lo que releemos: un techo de corpus trunca un tema demasiado denso. Es un límite real de ingeniería, tiene un ticket, se corregirá. No lo maquillamos como una elección.

No nos creas sin más

El corrector y los veredictos son públicos. Audítalos.

El corrector publicado y los veredictos por pregunta te dejan re-derivar la puntuación en un comando. Sin motor, sin red. La metodología completa, el análisis de causas y los 16 logs en bruto están abiertos también.