[!NOTE] TL;DR Le codage contextuel distingue un fait de la situation dans laquelle il était vrai. Mes expériences sur le rappel temporel suggèrent qu'une date seule ne suffit pas à retrouver le bon épisode. Pour un agent IA, je propose un index CTX qui teste la compatibilité du contexte avant de rédiger une réponse, sans prétendre que le cerveau fonctionne comme une base de données.
Les 713 secondes
Deux images séparées de 713 s ne disent pas tout. Dans mon étude du codage contextuel, j'ai comparé des scènes de film séparées par une même distance temporelle, prises soit dans la même intrigue, soit dans des intrigues différentes. Mon chronomètre (greffier très ponctuel) aurait classé les deux paires de la même façon. Il ignorait le scénario.
Le lendemain du visionnage, les participants devaient désigner la scène apparue en premier. Le protocole comportait 32 essais par condition, avec des distances temporelles appariées entre les conditions. Les 713 s correspondent à un exemple illustré dans l'étude, pas à un seuil cognitif. La distinction compte : je ne peux pas attribuer un résultat statistique à cette seule paire.
Nos analyses ont trouvé une modulation de la performance et de l'activité du précuneus selon l'appartenance des scènes à la même intrigue. L'effet non linéaire de la distance sur les temps de réponse différenciait les conditions, avec p = 0,004 pour leur comparaison. J'en tire une intuition pour l'IA : retrouver un fait par sa date ou ses mots ne garantit pas que tu retrouves le bon fait pour la situation courante. Je décris ici un problème de sélection, distinct de la question de la mémoire reconstructive.
Une question de situation
Ma question principale est simple : comment un agent peut-il distinguer deux informations également pertinentes sur le plan lexical, mais vraies dans des contextes différents ? Tu connais le cas en production. Une procédure approuvée hier pour un environnement de test ressemble beaucoup à celle qui concerne aujourd'hui l'environnement réel. Un moteur vectoriel peut placer les deux documents côte à côte sans savoir lequel gouverne la demande.
On imagine spontanément qu'une fenêtre plus longue résout le problème : il suffirait d'y verser davantage de documents. Les mesures disent autre chose, au moins pour les modèles évalués dans Lost in the Middle, ACL Anthology. Dans leur expérience de questions-réponses sur NaturalQuestions-Open, passer de 20 à 50 documents n'améliorait la performance du lecteur que d'environ 1,5 % pour GPT-3.5-Turbo et 1 % pour Claude-1.3. La position de la preuve dans le contexte modifiait également la réussite. Ces modèles datent de l'étude publiée en 2024 ; je ne transpose pas ces chiffres aux modèles actuels.
Voici le trajet que je propose pour CTX, un index conceptuel du contexte. Le diagramme décrit une hypothèse d'architecture, pas un service que j'aurais déjà évalué.
flowchart LR
A["Question et situation courante"] --> B["CTX : identifier la situation"]
B --> C["Recherche de faits candidats"]
C --> D["Comparer situation et preuves"]
D --> E["Reponse avec source"]
D --> F["Abstention si contexte incertain"]
Le codage contextuel
Dans l'expérience sur le film, l'intervalle entre deux scènes restait comparable alors que leur appartenance narrative changeait. C'était le point de la manipulation. Si tu n'observes que le temps écoulé, tu rates une partie de ce qui rend l'ordre récupérable. L'article de mon équipe dans The Journal of Neuroscience documente ce contraste comportemental et son corrélat dans le précuneus.
Il serait pourtant faux d'en conclure que le cerveau abandonne toute chronologie générale. Nos analyses multivariées suggéraient aussi une représentation des distances temporelles moins dépendante de l'intrigue ; dans un contrôle ciblé entre intrigues, le résultat de groupe restait sous le seuil conventionnel, p = 0,097. Je garde donc deux idées distinctes : une modulation par le contexte attestée dans notre tâche, et une piste sur un code temporel plus général qui demande davantage de prudence. Bien que cette dernière analyse ne tranche pas tout, elle évite la caricature du « contexte seul ».
J'ai ensuite déplacé la mesure hors du film. Dans notre protocole publié par Scientific Reports, un téléphone envoyait des images d'objets à des participants dans leur vie quotidienne, sur une période pouvant atteindre 3 semaines. Le système enregistrait le lieu et le moment de chaque présentation. Au rappel, la mémoire de la source contribuait au statut subjectif de l'objet, et la similarité temporelle influençait les jugements d'ordre entre événements. Ce résultat ne mesure aucun agent IA. Il m'oblige simplement à traiter la provenance comme autre chose qu'une décoration ajoutée après la recherche.
D'autres données rendent le tableau moins dépendant de mes expériences. Dans l'étude de PNAS sur des souvenirs vécus, 9 participants ont recueilli en moyenne 5 414 images chacun, avec une erreur standard de 578 images, avant le test en IRMf. Dans l'hippocampe antérieur gauche, les distances neurales lors du rappel variaient avec les distances spatiales et temporelles des événements : p corrigé = 0,021 pour l'espace et 0,010 pour le temps. Les auteurs limitaient l'analyse à des paires séparées de plus de 100 m et de 16 h. Une scène quotidienne n'est pas une liste de mots sur écran.
Un autre protocole isole plus directement l'association entre objet et contexte. Avec 11 patients, l'étude de Nature Communications comparait la reconnaissance d'images dans le lieu initial et dans un autre lieu virtuel. Le signal hippocampique distinguait l'association entre image et contexte spatial, p corrigé = 0,026, alors que le cortex temporal latéral montrait une réactivation spécifique de l'image moins dépendante de ce contexte. Cette dissociation m'intéresse davantage qu'une analogie simpliste entre un neurone et un embedding. On peut représenter un contenu et sa situation sans les confondre.
CTX et ses deux horloges
L'hypothèse de la double horloge est une proposition de design, pas une conclusion neuroscientifique. Pour chaque fait candidat, CTX distingue le moment où l'événement s'est produit du moment où la source a été enregistrée. Une correction reçue aujourd'hui peut concerner une décision prise mardi. Trier uniquement par date d'ingestion ferait gagner la correction, même si ta question demande ce que l'équipe savait mardi.
Je définirais aussi un identifiant de contexte (projet, environnement ou épisode de travail), un lien vers la preuve d'origine et un intervalle de validité lorsqu'il est connu. Ce dernier champ peut rester inconnu. Inventer une date de fin serait plus dangereux que l'avouer. La recherche sémantique produirait d'abord des candidats ; CTX comparerait ensuite leur portée à la situation demandée, sans éliminer d'office les contre-exemples utiles à un audit.
| Dimension | Recherche par similarité seule | CTX proposé | Erreur à tester |
|---|---|---|---|
| Temps de l'événement | Privilégie le texte proche | Conserve le moment décrit | Confond ancien fait et correction récente |
| Temps d'enregistrement | Peut favoriser la nouveauté | Sépare réception et événement | Antidate implicitement une connaissance |
| Contexte de travail | Rapproche deux procédures voisines | Vérifie l'environnement cité | Applique le test au réel |
| Preuve d'origine | Retourne un passage plausible | Exige une référence consultable | Répond sans pouvoir attribuer le fait |
Pense à deux horloges fixées au mur d'un atelier : l'une marque l'heure de la panne, l'autre celle où le rapport est arrivé. Les aiguilles peuvent indiquer des instants différents sans que l'une soit cassée. Dans CTX, les réunir en une seule colonne ferait perdre cette distinction physique. C'est une image de conception, non une description anatomique.
Cette séparation change le test d'un agent. Je comparerais quatre configurations sur les mêmes demandes : similarité seule, métadonnées seules, CTX combiné et CTX avec étiquettes de contexte permutées. La permutation est mon contrôle négatif. Si elle ne dégrade pas les réponses correctement attribuées, mon supposé codage contextuel n'apporte peut-être rien. Je mesurerais la justesse de la source citée, les erreurs entre environnements et l'abstention, puis les temps de réponse aux percentiles 50 et 95. Je n'ai pas ces mesures. Je refuse de transformer cette proposition en gain annoncé.
Objections et protocole restant
La première objection est pratique : le contexte n'arrive pas toujours avec une étiquette. Dans une conversation, « mardi » peut désigner le jour de l'incident ou celui du compte rendu. J'autoriserais donc une valeur inconnue, plutôt que de déduire une certitude d'un timestamp. Et je demanderais confirmation lorsque deux interprétations changent l'action recommandée. Cette décision augmente parfois la friction. Elle peut aussi éviter une réponse fausse et bien formulée.
La seconde objection concerne le coût du cadrage. Un filtre trop strict peut exclure un document valable pour plusieurs environnements. Un schéma de contexte trop détaillé peut devenir plus fragile que l'index initial. Mon tableau propose des champs à éprouver, non une ontologie universelle. La bonne échelle dépend du produit : un agent qui suit des incidents sur quelques heures n'a pas les mêmes frontières qu'un assistant qui examine des décisions prises sur des mois.
Enfin, mes preuves humaines ont des limites précises. Le protocole des souvenirs vécus comptait 9 participants, et celui de navigation virtuelle 11 patients dont les électrodes répondaient à des contraintes cliniques. Ma propre expérience sur le film manipulait des intrigues, pas des documents contradictoires dans un système de production. Les résultats sur les LLM concernent des modèles identifiés, pas une loi de l'attention artificielle. Rien ici ne démontre qu'ajouter CTX améliore automatiquement un agent.
Cela pourrait être testé avec des questions dont la réponse change lorsque seule la situation change, en gardant identiques les documents candidats et le budget de tokens. Je publierais les échecs par type de confusion et vérifierais si la permutabilité du contexte détruit effectivement la précision des sources. Si tu veux éprouver ce protocole sur tes propres flux, tu peux examiner mes produits ou me contacter. Pas besoin de lui dessiner un hippocampe.
Au-delà du timestamp
Plus généralement, un fait ne devient pas pertinent parce qu'il est proche dans un espace vectoriel ; il doit aussi appartenir à la situation que tu interroges. C'est le principe que je retiens de mes expériences, sans prêter au modèle une mémoire humaine. Mon chronomètre peut rester sur le bureau : je lui demande seulement de ne plus diriger l'enquête.