通过细化局部学习系数分析注意力头的差分化与专业化
机器学习
2024-10-07 v1 人工智能
摘要
我们引入了局部学习系数 (LLC) 的细化变体,这是一种基于奇异学习理论建模复杂度的度量,用于研究 transformer 语言模型在训练期间内部结构的发展。通过将这些细化 LLC (rLLC) 应用于两个层的仅注意力变换器的各个组件,我们获得了关于注意力头在训练过程中差分化和专业化的新见解。我们的 methodology 揭示了注意力头如何发展为具有不同功能角色,分析了这些头专门处理的数据类型,并发现了一种此前未被识别的多gram 电路。这些发现表明 rLLC 提供了一种原则性的、量化的 developmental interpretability 工具,用于通过学习过程中的演变来理解模型。更广泛地说,这项工作为建立数据分布结构、损失景观的几何属性、学习动力学和神经网络中涌现计算结构之间的对应关系迈出了一步。
引用
@article{arxiv.2410.02984,
title = {Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient},
author = {George Wang and Jesse Hoogland and Stan van Wingerden and Zach Furman and Daniel Murfet},
journal= {arXiv preprint arXiv:2410.02984},
year = {2024}
}