注意力并非记忆保持:无限上下文架构中的正交性约束
神经元与认知
2026-02-05 v2 人工智能
摘要
生物记忆解决了一个当前 AI 未能解决的问题:存储特定情景事实而不破坏一般语义知识。互补学习系统理论通过两个子系统解释了这一点——一个使用稀疏、模式分离表征来处理情景的快速海马系统,和一个使用分布式表征来处理统计规律的缓慢新皮层系统。当前 AI 系统缺乏这种分离,试图仅通过神经权重来同时实现这两种功能。我们确定了正交性约束:可靠的记忆需要正交键,但语义嵌入不能是正交的,因为训练会将相似的概念聚类在一起。结果是语义干扰(与认知心理学家在人类记忆中长期观察到的现象相联系),即将事实写入共享连续参数的神经系统在处理几十个语义相关的事实内就会崩溃至接近随机的准确率。通过语义密度(rho,即成对余弦相似度的平均值),我们表明崩溃发生在 N=5 个事实时(rho > 0.6)或 N ~ 20-75 时(中等 rho)。我们在多种模态下进行了验证:16,309 个 Wikipedia 事实、科学测量值(rho = 0.96,在 N=10,000 时准确率为 0.02%)以及图像嵌入(rho = 0.82,在 N=2,000 时为 0.05%)。这种失败是几何性的——当键共享语义重叠时,模型容量的任何增加都无法克服干扰。我们提出了知识对象:具有基于哈希的身份、受控词汇表和显式版本链的结构化事实。在 Wikipedia 事实上,KO 检索达到了 45.7% 的准确率,而现代 Hopfield 网络崩溃至接近零;基于哈希的检索保持了 100%。生产系统(Claude Memory、ChatGPT Memory)存储非结构化文本,导致模式漂移(40-70% 一致性)和版本歧义。知识对象提供了离散的海马组件,从而实现可靠的双院记忆。
引用
@article{arxiv.2601.15313,
title = {Attention Is Not Retention: The Orthogonality Constraint in Infinite-Context Architectures},
author = {Oliver Zahn and Matt Beton and Simran Chana},
journal= {arXiv preprint arXiv:2601.15313},
year = {2026}
}
备注
32 Pages, 7 Figures