Mnemosyne OS

Benchmark · LongMemEval-M · full-haystack

72,9 % en la variante que nadie cita.

Todo el mundo cita LongMemEval. Casi nadie corre el full-haystack: ~480 sesiones distractoras por pregunta — la variante honesta, la más dura. Publicamos la cifra como un suelo, con el protocolo, los fallos, y todo lo necesario para recalcularla tú mismo.

La cifra

72,9% LongMemEval-M, variante full-haystack:
~480 sesiones distractoras por pregunta.
La variante honesta. La más dura.

Existe una versión más cómoda de este benchmark. Es la que la industria muestra. Nosotros corrimos la otra, y publicamos la cifra como un suelo: dos categorías nunca se volvieron a jugar con el motor completo, por falta de tiempo de cómputo. Otros modelos quedan también por probar.

Ninguna pregunta se eligió a posteriori. Una sola configuración para todo el mundo. Y un acierto solo cuenta si se reproduce.

Lo que se midió

MedidaAntesDespuésΔCondiciones
Full-haystack, 48 q64,6 %72,9 %+8,3todos los motores
Multisesión1/85/8+4la categoría más dura
Ruta real executeQuery, 61 q78,7 %83,6 %+4,9topK 32
Temporal (A/B inline)7/1010/10+3reproducido ×2
Recall a ~1 M vectores1.000MNEMO_ANN
100 % local, cero cloud~50 %sueloQwen2.5-3B · Vulkan · n=12 · máquina cargada

La línea «100 % local» merece su precisión: es un suelo, no un techo. Un modelo de tres mil millones de parámetros, sobre doce preguntas, en una máquina ocupada en otra cosa. Los grandes modelos locales de razonamiento, aún no tenemos la potencia para probarlos — así que no sabemos hasta dónde sube, y no lo pretendemos.

Y las palancas que no dieron nada, porque cuentan igual: ledgers de relaciones (peor), pasada maestra (peor), pre-clasificación k-means (nula), barrido de reserva (ruido). Los números primos no portan ninguna señal de memoria — falsado seis veces, enterrado.

La sección que nadie escribe

Lo que fallamos.

En el full-haystack, tres preguntas todavía se resisten. Están descompuestas línea a línea. Aquí están.

×2 — estructural al benchmark

El benchmark apila varios usuarios en una sola memoria. El proyecto de un desconocido se vuelve indistinguible del tuyo en el texto servido. Ningún filtro del lado de la respuesta puede decidir — verificado. Mnemosyne es soberano y monohumano: este modo de fallo no existe en ti. No perseguiremos esos dos puntos.

×1 — nuestra deuda, no nuestro diseño

Un desequilibrio entre lo que escribimos y lo que releemos: un techo de corpus trunca un tema demasiado denso. Es un límite real de ingeniería, tiene un ticket, se corregirá. No lo maquillamos como una elección.

No nos creas sin más

El corrector y los veredictos son públicos. Recalcula.

El corrector publicado y los veredictos por pregunta te dejan re-derivar la puntuación en un comando — sin motor, sin red. La metodología completa, el análisis de causas y los 16 logs en bruto están abiertos también.