Ce qu'il fait
Une question. Une réponse tirée de tes propres sources.
Mnemosyne vectorise ton code, tes docs, tes notes, tes conversations — et plus encore, puis choisit les vaults à interroger, dose le contexte, hiérarchise et écarte les sources qui n'apportent rien. Le tout sur ton processeur, sans qu'une ligne ne quitte ton disque.
Et le dosage compte plus que la quantité : à modèle, question et récupération identiques, 91 sources injectées donnent une réponse creuse ; 12 sources choisies donnent une synthèse structurée.
L'architecture
Tout tient dans ta machine. Un seul trait en sort.
Le noyau interroge ta mémoire, la trie, et la consolide quand la machine est au repos. Les cartouches — le lecteur, le CRM, le traducteur — se branchent dessus sans jamais y toucher : chacune écrit dans son coffre, isolé de la recherche et invisible au reste.
Pare-feu cognitif
Entre tes données et le modèle, un poste de garde.
Le modèle ne touche jamais ton coffre . Chaque récupération est assemblée côté machine, filtrée, et seules les sources retenues lui sont tendues — la frontière est voulue : c'est ce qui empêche un prompt malin d'exfiltrer ta mémoire.
Zero-Trust , même en local : chaque requête du SDK ou du MCP porte un jeton signé à portée limitée (FGAC ). Et quand rien de pertinent ne ressort, la mémoire s'abstient — elle te le dit plutôt que d'inventer.
Comment ça marche
Quatre mécanismes, et pourquoi ils existent.
I
Les vaults
Ta mémoire n'est pas un tas. Elle est découpée en coffres étanches, un par domaine de vie, chacun avec ses propres droits : qui peut le lire, avec quoi il a le droit d'être mélangé, s'il apparaît sur la carte. Ton journal intime ne se mélange à ton code que si tu le décides. Jamais par défaut, jamais par accident.
II
Les sujets
La mémoire se range toute seule en sujets, et cette structure est stockée comme une donnée — pas comme un effet de bord. C'est elle qui rend le reste possible.
III
L'état de rêve
Machine au repos, Mnemosyne relit sa propre mémoire, sujet par sujet, et en écrit le registre : chaque occurrence, chaque valeur, chaque date, le total courant. Le registre se pose à côté du brut — jamais à sa place. C'est ce qui vaut +4,9 points sur le vrai chemin de requête et 1/8 → 5/8 sur la catégorie la plus dure. Pas « il double ta mémoire ». Ça.
IV
Le pacte du bac à sable
Chaque application reçoit exactement un coffre, isolé de la recherche fédérée, invisible à la carte et au rêve. Elle ne peut pas élargir ses propres murs : ouvrir la permanence est une opération que le réseau ne peut pas atteindre — seule ta main sur ton clavier le peut. Un agent peut proposer. Il ne peut pas graver.
Le moteur
N'importe quel modèle. Local ou cloud. La même mémoire.
Choisis le meilleur modèle pour chaque tâche — le cloud pour la puissance brute, le local pour une confidentialité absolue. Dessous, la mémoire ne change pas : tu changes de fournisseur sans rien perdre.
Raisonnement & chat
Embeddings & résonance
Hubs & fournisseurs
Sous le capot
Les moteurs.
Pas une grosse boîte noire « IA » — plusieurs moteurs indépendants, chacun son travail :
Moteur d'embedding
Une chaîne de fournisseurs ordonnée par priorité — cloud, ONNX local, Ollama. Échoue bruyamment plutôt que de rendre un vecteur nul : un embedding raté ne doit jamais devenir en silence une mémoire invisible.
Moteur de récupération
Un cache vectoriel déchiffré en RAM (quantisé int8 pour tenir l'échelle). Recherche ANN unie au matching exact de termes, puis re-classement final.
Moteur de spine
Classe chaque souvenir par nature sémantique — son « spine » + tags — depuis une taxonomie qui vit comme donnée, pas comme logique codée. Une nouvelle catégorie n'exige aucun changement de code.
Dream State
Consolidation à deux vitesses : un étage rapide extrait les faits pendant l'usage, un étage lourd tourne à l'inactivité/la nuit pour résoudre les contradictions et relier les sessions. Ajouté à côté de la récupération brute, sans jamais la remplacer en silence.
RAG adaptatif — la boîte de vitesses
La sélection de contexte (top-k / MMR / échantillonnage à faible divergence) s'adapte au modèle que tu fais tourner et au mode de réflexion choisi — au lieu d'injecter tous les candidats.
Voix — STT & TTS
Moteurs indépendants : petits modèles STT in-process, gros modèles dans un sidecar GPU/CPU isolé ; TTS système, cloud ou local, cadencé à l'échantillon pour une lecture sans coupure. Pas de GPU NVIDIA → repli CPU, jamais de blocage sec.
242 canaux IPC
Des canaux validés par Zod relient chaque moteur à l'interface — auto-générés et vérifiés par un test de dérive à chaque build.
Les modules
Neuf modules. Un seul noyau.
Pas une grosse boîte « IA », mais des modules indépendants, taillés chacun pour sa tâche, tous branchés sur le même cœur mémoire. Voici ce que tu vois et manipules — les moteurs internes, eux, restent scellés.
Neural Map
Ta mémoire rendue en topologie mathématique vivante : les nœuds sont des mémoires, les arêtes des liens sémantiques mesurés, réglés en direct.
État de rêve
Un moteur de consolidation qui relit et relie tes mémoires pendant les phases de repos.
Coffres
Une mémoire cloisonnée par domaine de vie, chacun avec son niveau de protection et sa frontière de consentement.
RAG adaptatif
La profondeur de récupération et le tri s’adaptent au modèle que tu fais tourner — du LLM de portable au modèle cloud de pointe.
Assistant vocal
Voix locale ou cloud, STT/TTS en streaming, lecture locale sans coupure.
Chat multimodal
Conversation texte, voix et fichiers, avec récupération en direct depuis tes propres coffres.
MnemoHub
Un catalogue de cartouches signé par un wallet souverain et vérifié côté client avant tout rendu.
Wallet souverain & Engramm
Un wallet Web3 local pilote la licence (vérifiée sur Base), le pseudonyme et les crédits cloud — sans compte, sans mot de passe, sans frais de gaz.
Canvas spatial
Les widgets vivent sur un canvas 2D, pas des onglets empilés : la position porte du sens.