中文

基于机制可解释性的 grokking 进度度量

机器学习 2023-10-23 v3 人工智能

摘要

神经网络常表现出涌现行为,即通过增加参数量、训练数据或训练步数,产生质变式的新能力。理解涌现的一种方法是寻找看似不连续的质变背后的连续 \textit{进度度量}。我们认为,可以通过机制可解释性(即将学习到的行为逆向工程为其各个独立组件)来找到进度度量。作为案例研究,我们研究了在模加法任务上训练的小型 Transformer 所表现出的最近发现的“grokking”现象。我们完全逆向工程了这些网络学习到的算法,该算法使用离散傅里叶变换和三角恒等式将加法转换为绕圆的旋转。我们通过分析激活值和权重以及在傅里叶空间中进行消融实验来验证了该算法。基于这一理解,我们定义了进度度量,使我们能够研究训练的动力学,并将训练分为三个连续阶段:记忆、电路形成和清理。我们的结果表明,grokking 并非一种突变,而是源于对编码在权重中的结构化机制的逐步放大,随后移除记忆组件。

关键词

引用

@article{arxiv.2301.05217,
  title  = {Progress measures for grokking via mechanistic interpretability},
  author = {Neel Nanda and Lawrence Chan and Tom Lieberum and Jess Smith and Jacob Steinhardt},
  journal= {arXiv preprint arXiv:2301.05217},
  year   = {2023}
}

备注

10 page main body, 2 page references, 24 page appendix