Le dimos la memoria a la personalidad. Costó 31 puntos.
La idea más seductora que construimos este año era falsa, y tenemos las pruebas.
Mnemosyne OS tiene una lente cognitiva: dieciséis arquetipos al estilo MBTI que cambias desde el raíl del chat, para que el asistente piense como un INTJ o un ENFP durante una pregunta. La implementación obvia es en el prompt, una línea de persona en el system prompt. Fuimos más lejos, porque la versión más lejana sonaba demasiado bien:
Un arquetipo que mantiene sus opciones abiertas (ENFP) debería leer una porción más amplia y diversa de tu memoria que uno que converge (ISTJ).
Así que la lente también dirigía la capa de retrieval: cada arquetipo se proyectaba sobre un perfil de selección de memoria, un peso de diversidad (λ del MMR) y una estrategia de selección, del top-k simple al MMR hasta un muestreador de baja discrepancia que apodamos phyllotaxis. La personalidad no solo cambiaría cómo el asistente habla. Cambiaría lo que recuerda.
Si construyes sistemas de memoria, has sentido la atracción de esta idea. Así se ve una vez medida.
La medición
Una porción in-vault de 61 preguntas de LongMemEval, recuerdo factual sobre memoria conversacional de largo plazo. Embeddings idénticos en todas las condiciones; la lente solo re-clasifica y selecciona entre candidatos ya recuperados. Un control, varios perfiles, ejecuciones reales.
| Condición | Precisión |
|---|---|
| Sin lente (control) | 75,4 % |
| Perfiles convergentes (tipo ISTJ) | 75,4 %, veredictos idénticos |
| Divergencia máxima (λ=0,40 + baja discrepancia) | 44,3 % |
Menos 31,1 puntos. Análisis pareado: 21 aciertos del control perdidos, 2 ganados, test de signos unilateral p < 10⁻⁴. Y lo refutado es la dirección del diseño, no solo su magnitud: el perfil divergente debía brillar en las preguntas multi-sesión. Las hundió de 3/10 a 1/10, y aplastó el razonamiento temporal de 9/10 a 2/10.
La ablación, dos palancas suaves, una catástrofe
| Configuración | Coste vs control |
|---|---|
| Solo el peso de diversidad (λ=0,40, MMR intacto) | −11,5 pts |
| Solo el muestreo de baja discrepancia (λ intacto) | −6,5 pts |
| Ambos juntos | −31,1 pts |
Dos palancas individualmente sobrevivibles y conjuntamente catastróficas, una dilución super-aditiva de la cabeza de relevancia. Cada una afloja el agarre sobre el recuerdo correcto; juntas, lo sueltan.
Dos datos más que te debemos. Una réplica completa del control reprodujo los 61 veredictos por pregunta exactamente, el ruido entre ejecuciones en esta máquina es cero, así que la brecha es la brecha. Y una confesión de diseño: como nuestra proyección arquetipo→retrieval derivaba de dos ejes binarios, las dieciséis personalidades colapsaban en cuatro comportamientos de memoria. Dieciséis caras, cuatro memorias.
El bug que no vimos venir
El lado del estilo tenía su propia lección. Las líneas de tono no afectan a la precisión, pero nuestro vocabulario de personas estaba escrito en francés, y una línea de tono en francés dentro de un prompt en inglés resultó ser una instrucción de idioma: los brazos con lente respondieron en francés a un benchmark en inglés en el 8–54 % de los casos, dijeran lo que dijeran las reglas de abajo. Un bloque de persona nunca es solo decoración. El modelo lo lee todo.
Lo que salió en su lugar
En la v1.3.6 la lente es un disfraz, no un filtro. Cambia una sola cosa, la voz: el tono, el ángulo, la manera. El retrieval permanece exacto, hable quien hable. El mapa medido queda en el código como registro del porqué, y volver a acoplar personalidad y retrieval exige ahora una guarda por tipo de tarea, medida, no una intuición, por elegante que sea.
La lección general, dicha sin adornos: la personalidad en el prompt es prácticamente gratis; la personalidad en el retrieval tiene un coste factual medible. Si tu producto promete memoria, la memoria no puede depender del humor con el que vestiste al asistente.
Por qué publicar un resultado negativo
Porque la afirmación «nuestra memoria es exacta» solo vale lo que puedas comprobar. El 72,9 % de nuestra página de benchmark se publica con su kit de auditoría; este experimento se publica con sus cifras, su hipótesis refutada y su bug. Mnemosyne OS es un OS de memoria local-first, el punto es poder confiar en lo que recuerda. Esa confianza se construye con mediciones, incluidas las que nos dijeron que no.
La lente cognitiva, edición disfraz, está disponible en Mnemosyne OS v1.3.6. La arquitectura del motor de memoria está descrita en el whitepaper Resonance Engine.