基于新型注意力残差流体系结构的类比记忆在类比学习中的改进
神经与进化计算
2025-08-05 v2 人工智能
计算与语言
摘要
大型语言模型 (LLM) 在利用其输入序列上下文信息以恰当方式响应训练期间未见数据方面表现出惊人的能力。这种能力称为类比学习 (ICL)。人类和非人类动物表现出类似能力,但其神经结构与 LLM 截然不同。尽管如此,LLM 的关键组件——注意力机制——类似于现代类比记忆模型,这些模型广泛用于受计算神经科学社区影响以建模生物记忆系统。基于这一联系,我们引入一种能够执行 ICL 的类比记忆模型。我们以此为灵感提出一种新的残差流体系结构,允许注意力头之间直接传递信息。我们在两个层的 Transformer 中测试该体系结构,发现其 ICL 能力的表现速度快于未采用此修改的模型。随后我们将该体系结构应用于 800 万参数和 10 亿参数的小型语言模型,聚焦注意力头值,结果同样表明在更大更自然的规模下性能提升。
引用
@article{arxiv.2412.15113,
title = {Associative memory inspires improvements for in-context learning using a novel attention residual stream architecture},
author = {Thomas F Burns and Tomoki Fukai and Christopher J Earls},
journal= {arXiv preprint arXiv:2412.15113},
year = {2025}
}
备注
35 pages, 14 figures, 6 tables; accepted and published in TMLR