中文

它全部相连:穿越测试时记忆、注意力偏置、保持与在线优化之旅

机器学习 2025-04-18 v1 人工智能

摘要

设计高效且有效的架构主干一直是提升基础模型能力研究工作的核心。受人类认知中注意力偏置现象——自然倾向于优先考虑某些事件或刺激——的启发,我们重新概念化神经网络架构,包括Transformer、Titans和现代线性循环神经网络,将其视为学习键值映射的关联记忆模块,内部目标称为注意力偏置。惊讶地发现,大多数现有序列模型要么使用点积相似度,要么使用L2回归目标作为其注意力偏置。超越这些目标,我们提出了一组替代性注意力偏置配置及其有效近似,以稳定训练过程。随后,我们将现代深度学习架构中的遗忘机制重新解释为一种保留正则化,为序列模型提供一套新的遗忘门。基于这些洞见,我们提出Miras框架,用于基于四个选择项设计深度学习架构:(i)关联记忆架构,(ii)注意力偏置目标,(iii)保留门,(iv)记忆学习算法。我们提出了三个新型序列模型——Moneta、Yaad和Memora——超越现有线性循环神经网络的能力,同时保持快速可并行化的训练过程。我们的实验显示,Miras中的不同设计选择导致模型具有不同强项。例如,Miras的某些实例在语言建模、常识推理和记忆密集型任务中表现卓越,甚至超过Transformer和其他现代线性循环模型。

关键词

引用

@article{arxiv.2504.13173,
  title  = {It's All Connected: A Journey Through Test-Time Memorization, Attentional Bias, Retention, and Online Optimization},
  author = {Ali Behrouz and Meisam Razaviyayn and Peilin Zhong and Vahab Mirrokni},
  journal= {arXiv preprint arXiv:2504.13173},
  year   = {2025}
}