Mnemosyne OS
Nouveau La documentation est en ligne : chaque moteur, pas à pas. docs.mnemosyne-os.io →
← Tous les articles

On a confié la mémoire à la personnalité. Coût : 31 points.

Publié le 3 août 2026 4 min de lecture

personalityretrievalbenchmarknegative-resultmemory

L’idée la plus séduisante qu’on ait construite cette année était fausse, et on a les preuves.

Mnemosyne OS a une lentille cognitive : seize archétypes façon MBTI que tu bascules depuis le rail du chat, pour que l’assistant pense en INTJ ou en ENFP le temps d’une question. L’implémentation évidente est côté prompt, une ligne de persona dans le system prompt. On est allés plus loin, parce que la version plus loin sonnait tellement juste :

Un archétype qui garde ses options ouvertes (ENFP) devrait lire une tranche plus large et plus diverse de ta mémoire qu’un archétype qui converge (ISTJ).

La lentille pilotait donc aussi la couche de retrieval : chaque archétype projeté sur un profil de sélection mémoire, un poids de diversité (λ du MMR) et une stratégie de sélection, du top-k simple au MMR jusqu’à un échantillonneur basse-discrépance qu’on surnomme phyllotaxis. La personnalité n’allait pas seulement changer comment l’assistant parle. Elle allait changer ce dont il se souvient.

Si tu construis des systèmes de mémoire, tu as senti l’attraction de cette idée. Voilà ce qu’elle donne une fois mesurée.

La mesure

Une tranche in-vault de 61 questions de LongMemEval, rappel factuel sur de la mémoire conversationnelle de long terme. Embeddings identiques dans toutes les conditions ; la lentille ne fait que re-classer et sélectionner parmi des candidats déjà récupérés. Un contrôle, plusieurs profils, des runs réellement exécutés.

ConditionPrécision
Sans lentille (contrôle)75,4 %
Profils convergents (type ISTJ)75,4 %, verdicts identiques
Divergence maximale (λ=0,40 + basse-discrépance)44,3 %

Moins 31,1 points. Analyse appariée : 21 réussites du contrôle perdues, 2 gagnées, test des signes unilatéral p < 10⁻⁴. Et c’est la direction du design qui est réfutée, pas seulement son ampleur : le profil divergent devait briller sur les questions multi-sessions. Il les fait chuter de 3/10 à 1/10, et écrase le raisonnement temporel de 9/10 à 2/10.

L’ablation, deux leviers doux, une catastrophe

ConfigurationCoût vs contrôle
Poids de diversité seul (λ=0,40, MMR conservé)−11,5 pts
Échantillonnage basse-discrépance seul (λ conservé)−6,5 pts
Les deux ensemble−31,1 pts

Deux leviers individuellement survivables, conjointement catastrophiques, une dilution super-additive de la tête de pertinence. Chacun désserre la prise sur le bon souvenir ; ensemble, ils le lâchent.

Deux faits qu’on te doit encore. Une réplique complète du contrôle a reproduit les 61 verdicts par question à l’identique, le bruit inter-runs sur cette machine est nul, donc l’écart est l’écart. Et une confession de design : notre projection archétype→retrieval dérivait de deux axes binaires, les seize personnalités s’effondraient donc en quatre comportements mémoire. Seize visages, quatre mémoires.

Le bug qu’on n’a pas vu venir

Le versant style avait sa propre leçon. Les lignes de ton n’affectent pas la précision, mais notre vocabulaire de persona était écrit en français, et une ligne de ton française dans un prompt par ailleurs anglais s’est révélée être une instruction de langue : les bras « lentille » ont répondu en français à un benchmark anglais dans 8 à 54 % des cas, quoi que disent les règles en dessous. Un bloc de persona n’est jamais du simple décor. Le modèle lit tout.

Ce qui a shippé à la place

Dans la v1.3.6, la lentille est un costume, pas un filtre. Elle change une seule chose, la voix : le ton, l’angle, la manière. Le retrieval reste exact, quel que soit celui qui parle. La carte mesurée reste dans le code comme trace du pourquoi, et re-coupler la personnalité au retrieval exige désormais un garde-fou par type de tâche, mesuré, pas une intuition, si élégante soit-elle.

La leçon générale, dite platement : la personnalité côté prompt est à peu près gratuite ; la personnalité côté retrieval a un coût factuel mesurable. Si ton produit promet de la mémoire, la mémoire ne doit pas dépendre de l’humeur dont tu as habillé l’assistant.

Pourquoi publier un résultat négatif

Parce que l’affirmation « notre mémoire est exacte » ne vaut que ce que tu peux vérifier. Le 72,9 % en une de notre page benchmark est livré avec son kit d’audit ; cette expérience est livrée avec ses chiffres, son hypothèse réfutée et son bug. Mnemosyne OS est un OS de mémoire local-first, tout l’intérêt est de pouvoir faire confiance à ce dont il se souvient. Cette confiance se construit avec des mesures, y compris celles qui nous ont dit non.

La lentille cognitive, édition costume, est live dans Mnemosyne OS v1.3.6. L’architecture du moteur mémoire est décrite dans le whitepaper Resonance Engine.

Partager

Citer cet article

Pas de DOI, un billet de blog n'est pas un dépôt. La citation porte sur la page elle-même.

APA

Mnemosyne OS. (4 août 2026). On a confié la mémoire à la personnalité. Coût : 31 points.. Mnemosyne OS. https://mnemosyne-os.io/fr/blog/personality-lens-31-points

BibTeX
@misc{mnemosyne-personality-lens-31-points,
  author       = {{Mnemosyne OS}},
  title        = {On a confié la mémoire à la personnalité. Coût : 31 points.},
  year         = {2026},
  month        = {8},
  day          = {4},
  howpublished = {Blog post, Mnemosyne OS},
  url          = {https://mnemosyne-os.io/fr/blog/personality-lens-31-points}
}