Mnemosyne OS
Nuevo La documentación está en línea: cada motor, paso a paso. docs.mnemosyne-os.io →
← Todos los artículos

Le dimos la memoria a la personalidad. Costó 31 puntos.

Publicado el 3 de agosto de 2026 4 min de lectura

personalityretrievalbenchmarknegative-resultmemory

La idea más seductora que construimos este año era falsa, y tenemos las pruebas.

Mnemosyne OS tiene una lente cognitiva: dieciséis arquetipos al estilo MBTI que cambias desde el raíl del chat, para que el asistente piense como un INTJ o un ENFP durante una pregunta. La implementación obvia es en el prompt, una línea de persona en el system prompt. Fuimos más lejos, porque la versión más lejana sonaba demasiado bien:

Un arquetipo que mantiene sus opciones abiertas (ENFP) debería leer una porción más amplia y diversa de tu memoria que uno que converge (ISTJ).

Así que la lente también dirigía la capa de retrieval: cada arquetipo se proyectaba sobre un perfil de selección de memoria, un peso de diversidad (λ del MMR) y una estrategia de selección, del top-k simple al MMR hasta un muestreador de baja discrepancia que apodamos phyllotaxis. La personalidad no solo cambiaría cómo el asistente habla. Cambiaría lo que recuerda.

Si construyes sistemas de memoria, has sentido la atracción de esta idea. Así se ve una vez medida.

La medición

Una porción in-vault de 61 preguntas de LongMemEval, recuerdo factual sobre memoria conversacional de largo plazo. Embeddings idénticos en todas las condiciones; la lente solo re-clasifica y selecciona entre candidatos ya recuperados. Un control, varios perfiles, ejecuciones reales.

CondiciónPrecisión
Sin lente (control)75,4 %
Perfiles convergentes (tipo ISTJ)75,4 %, veredictos idénticos
Divergencia máxima (λ=0,40 + baja discrepancia)44,3 %

Menos 31,1 puntos. Análisis pareado: 21 aciertos del control perdidos, 2 ganados, test de signos unilateral p < 10⁻⁴. Y lo refutado es la dirección del diseño, no solo su magnitud: el perfil divergente debía brillar en las preguntas multi-sesión. Las hundió de 3/10 a 1/10, y aplastó el razonamiento temporal de 9/10 a 2/10.

La ablación, dos palancas suaves, una catástrofe

ConfiguraciónCoste vs control
Solo el peso de diversidad (λ=0,40, MMR intacto)−11,5 pts
Solo el muestreo de baja discrepancia (λ intacto)−6,5 pts
Ambos juntos−31,1 pts

Dos palancas individualmente sobrevivibles y conjuntamente catastróficas, una dilución super-aditiva de la cabeza de relevancia. Cada una afloja el agarre sobre el recuerdo correcto; juntas, lo sueltan.

Dos datos más que te debemos. Una réplica completa del control reprodujo los 61 veredictos por pregunta exactamente, el ruido entre ejecuciones en esta máquina es cero, así que la brecha es la brecha. Y una confesión de diseño: como nuestra proyección arquetipo→retrieval derivaba de dos ejes binarios, las dieciséis personalidades colapsaban en cuatro comportamientos de memoria. Dieciséis caras, cuatro memorias.

El bug que no vimos venir

El lado del estilo tenía su propia lección. Las líneas de tono no afectan a la precisión, pero nuestro vocabulario de personas estaba escrito en francés, y una línea de tono en francés dentro de un prompt en inglés resultó ser una instrucción de idioma: los brazos con lente respondieron en francés a un benchmark en inglés en el 8–54 % de los casos, dijeran lo que dijeran las reglas de abajo. Un bloque de persona nunca es solo decoración. El modelo lo lee todo.

Lo que salió en su lugar

En la v1.3.6 la lente es un disfraz, no un filtro. Cambia una sola cosa, la voz: el tono, el ángulo, la manera. El retrieval permanece exacto, hable quien hable. El mapa medido queda en el código como registro del porqué, y volver a acoplar personalidad y retrieval exige ahora una guarda por tipo de tarea, medida, no una intuición, por elegante que sea.

La lección general, dicha sin adornos: la personalidad en el prompt es prácticamente gratis; la personalidad en el retrieval tiene un coste factual medible. Si tu producto promete memoria, la memoria no puede depender del humor con el que vestiste al asistente.

Por qué publicar un resultado negativo

Porque la afirmación «nuestra memoria es exacta» solo vale lo que puedas comprobar. El 72,9 % de nuestra página de benchmark se publica con su kit de auditoría; este experimento se publica con sus cifras, su hipótesis refutada y su bug. Mnemosyne OS es un OS de memoria local-first, el punto es poder confiar en lo que recuerda. Esa confianza se construye con mediciones, incluidas las que nos dijeron que no.

La lente cognitiva, edición disfraz, está disponible en Mnemosyne OS v1.3.6. La arquitectura del motor de memoria está descrita en el whitepaper Resonance Engine.

Compartir

Citar este artículo

Sin DOI, una entrada de blog no es un depósito. La cita apunta a la página.

APA

Mnemosyne OS. (4 de agosto de 2026). Le dimos la memoria a la personalidad. Costó 31 puntos.. Mnemosyne OS. https://mnemosyne-os.io/es/blog/personality-lens-31-points

BibTeX
@misc{mnemosyne-personality-lens-31-points,
  author       = {{Mnemosyne OS}},
  title        = {Le dimos la memoria a la personalidad. Costó 31 puntos.},
  year         = {2026},
  month        = {8},
  day          = {4},
  howpublished = {Blog post, Mnemosyne OS},
  url          = {https://mnemosyne-os.io/es/blog/personality-lens-31-points}
}