分布式关联 vs 零样例推理:对前馈层和注意力层的研究
机器学习
2025-03-10 v2 人工智能
计算与语言
机器学习
摘要
大型语言模型在涉及基本形式的零样例推理任务(例如生成连贯语言以及存储大量知识)方面取得了很大的成功。变压器架构背后的核心是前馈层和注意力层,人们常将前馈层与知识存储、注意力层与推理联系起来。本文我们在受控的人工合成环境中研究了这种区别,具体分析了某些下一个标记预测同时涉及分布式信息和零样例信息的情况。我们发现,前馈层倾向于学习简单的分布式关联,例如二元agram,而注意力层则关注零样例推理。我们的理论分析识别出梯度中的噪声是导致这种差异的关键因素。最后,我们通过在Pythia模型系列上进行消融实验,说明类似的差异在预训练模型中也会出现。
引用
@article{arxiv.2406.03068,
title = {Distributional Associations vs In-Context Reasoning: A Study of Feed-forward and Attention Layers},
author = {Lei Chen and Joan Bruna and Alberto Bietti},
journal= {arXiv preprint arXiv:2406.03068},
year = {2025}
}
备注
ICLR 2025