归纳头需要满足什么条件?上下文学习电路及其形成的机制研究
机器学习
2024-04-11 v1
摘要
上下文学习是 Transformer 模型中一种强大的涌现能力。先前在机制可解释性方面的工作已经确定了一个可能对上下文学习至关重要的电路元件——执行匹配与复制操作的归纳头 (IH)。在自然语言数据上训练大型 Transformer 时,IH 大约在损失函数出现显著相变的同时涌现。尽管有关于 IH 的可靠证据以及其与相变的有趣巧合,但对 IH 的多样性与涌现动力学知之甚少。为什么存在不止一个 IH,它们如何相互依赖?为什么 IH 会突然出现,使它们能够涌现的子电路是什么?我们通过在合成数据上训练,在受控环境中研究 IH 涌现动力学来回答这些问题。在此过程中,我们开发并分享了一种受光遗传学启发的全新因果框架,用于在整个训练过程中修改激活值。利用该框架,我们阐明了 IH 的多样性与可加性。通过在整个训练过程中钳制激活子集,我们随后识别了三个相互作用以驱动 IH 形成从而产生相变的底层子电路。此外,这些子电路揭示了形成的依赖数据的特性,例如相变时机,这已经展现了深入理解归纳头需要“满足条件”的子电路的前景。
关键词
引用
@article{arxiv.2404.07129,
title = {What needs to go right for an induction head? A mechanistic study of in-context learning circuits and their formation},
author = {Aaditya K. Singh and Ted Moskovitz and Felix Hill and Stephanie C. Y. Chan and Andrew M. Saxe},
journal= {arXiv preprint arXiv:2404.07129},
year = {2024}
}
备注
26 pages, 18 figures