预测语言模型预训练中感知头的出现
计算与语言
2026-02-10 v2
摘要
专业化注意头称为感知头(IH)被认为是现代语言模型在上下文学习能力背后的关键因素;然而,关于其出现,尤其是在语言建模情境中的精确特征仍缺乏。本研究调查了训练数据统计属性与 IH 在自然和人造训练数据情境下的形成之间的关系。我们证明了:(1)一个结合 batch size 和 context size 的简单方程预测 IH 形成的时间点,并且该出现点对模型大小不敏感;(2)surface bigram 重复频率和可靠性强烈影响 IH 的形成,我们发现这些两个值之间存在有效的 Pareto 前沿;(3)当 bigram 重复频率和可靠性较低时,局部依赖足以导致 IH 形成,但当频率和可靠性较低时,categoriality 和边际分布的形状也会影响 IH 的形成。
引用
@article{arxiv.2511.16893,
title = {Predicting the Emergence of Induction Heads in Language Model Pretraining},
author = {Tatsuya Aoyama and Ethan Gotlieb Wilcox and Nathan Schneider},
journal= {arXiv preprint arXiv:2511.16893},
year = {2026}
}