从捷径到归纳头:数据多样性如何塑造变形器中的算法选择
机器学习
2025-12-23 v1 机器学习
摘要
变形器可以实现通用可泛化算法(例如归纳头)和简单位置捷径(例如记忆固定输出位置)。在本工作中,我们研究预训练数据分布的选择如何引导浅层变形器采取一种行为或另一种行为。我们关注一个最小触发-输出预测任务——复制特定触发器在第二次出现后立即后续的 token。我们对单个单层变形器的基于梯度的训练进行严格分析。在无限和有限样本情境中,我们证明了所学机制中的一种转变:如果输入序列 exhibits 充分的多样性,通过触发器-触发器距离的低 "max-sum" 比率来衡量,训练得到的模型实现归纳头并对不可见的上下文进行泛化;相反,当该比率很大时,模型会采用位置捷径并无法在分布外(OOD)进行泛化。我们也揭示了预训练上下文长度与 OOD 泛化之间的权衡,并推导出最小化每个样本计算成本的最优预训练分布。最后,我们用受控合成实验验证了我们的理论预测,表明扩大上下文分布能稳健地诱导归纳头并实现 OOD 泛化。我们的结果阐明了预训练变形器的算法偏差,为数据驱动控制其所学行为提供了概念性指导。
引用
@article{arxiv.2512.18634,
title = {From Shortcut to Induction Head: How Data Diversity Shapes Algorithm Selection in Transformers},
author = {Ryotaro Kawata and Yujin Song and Alberto Bietti and Naoki Nishikawa and Taiji Suzuki and Samuel Vaiter and Denny Wu},
journal= {arXiv preprint arXiv:2512.18634},
year = {2025}
}
备注
NeurIPS 2025