中文

迈向模多项式上 Grokking Transformer 内部电路与属性的经验解释

机器学习 2024-12-31 v4 人工智能

摘要

Grokking 现象已被积极研究以揭示延迟泛化的奥秘,而识别 Grokking 模型内部可解释的表示和算法是理解其机制的有力线索。已知模加法上的 Grokking 在 Transformer 中实现了傅里叶表示及其带有三角恒等式的计算电路。考虑到模算术的周期性,一个自然的问题是这些解释和阐释在多大程度上适用于加法以外的其他模运算上的 Grokking。为了更深入地观察,我们首先假设任何模运算都可以用独特的傅里叶表示或内部电路来表征,Grokking 模型获得了可在相似运算间迁移的通用特征,且混合具有相似运算的数据集能促进 Grokking。随后,我们通过在学习复杂模算术任务(包括多项式)的 Transformer 上广泛检验这些假设。我们的傅里叶分析以及针对模算术的新颖进展度量——傅里叶频率密度和傅里叶系数比——刻画了每个模运算下 Grokking 模型的独特内部表示;例如,多项式通常导致初等算术中看到的傅里叶分量的叠加,但在具有挑战性的不可因式分解多项式中并未出现清晰的模式。相比之下,我们对 Grokking 前模型的消融研究表明,各运算 Grokking 模型之间的可迁移性仅限于特定的组合,例如从初等算术到线性表达式。此外,一些多任务混合可能导致协同 Grokking(即所有任务同时发生 Grokking)并加速泛化,而其他混合则可能无法找到最优解。我们为实现内部电路的可解释性提供了经验步骤。

关键词

引用

@article{arxiv.2402.16726,
  title  = {Towards Empirical Interpretation of Internal Circuits and Properties in Grokked Transformers on Modular Polynomials},
  author = {Hiroki Furuta and Gouki Minegishi and Yusuke Iwasawa and Yutaka Matsuo},
  journal= {arXiv preprint arXiv:2402.16726},
  year   = {2024}
}

备注

Published at Transactions on Machine Learning Research (TMLR), Code: https://github.com/frt03/grok_mod_poly