中文

学习记忆、学习与遗忘:基于注意力模型的 Palimpsa 模型

机器学习 2026-02-12 v2 人工智能

摘要

注意力机制中的原地学习 (In-Context Learning, ICL) 在变换器中表现为一种在线关联记忆,被认为是其在复杂序列处理任务中高性能的关键因素。然而,在门控线性注意力模型中,这种记忆具有固定容量,尤其在长序列场景下容易受到干扰。我们提出了 Palimpsa,一种自注意力模型,将 ICL 视为必须解决稳定性-塑性困境的持续学习问题。Palimpsa 采用贝叶斯元可塑性,其中每种注意力状态的可塑性与一个以先验分布为基础、捕获累积知识的重要性状态相挂钩。我们展示了各种门控线性注意力模型作为特定架构选择和后验近似的特例,Mamba2 是 Palimpsa 的一种特例,其中遗忘占主导。这种理论联系使得将任何非元可塑模型转化为元可塑模型成为可能,显著扩展了其记忆容量。我们的实验表明,Palimpsa 在多查询关联记忆 (Multi-Query Associative Recall, MQAR) 基准和常识推理任务上 consistently 优于基线方法。

关键词

引用

@article{arxiv.2602.09075,
  title  = {Learning to Remember, Learn, and Forget in Attention-Based Models},
  author = {Djohan Bonnet and Jamie Lohoff and Jan Finkbeiner and Elidona Skhikerujah and Emre Neftci},
  journal= {arXiv preprint arXiv:2602.09075},
  year   = {2026}
}