无树结构学习:理解变换器中的层次化泛化
计算与语言
2025-03-18 v3 机器学习
摘要
在自然语言数据上训练的变换器模型已被证明能够学习其层次结构,并能对结构未见的句子进行层次化泛化,而无需显式编码任何结构偏置。在本工作中,我们研究了变换器模型及其训练中诱导出生层次化泛化行为的源头。我们广泛实验不同的变换器模型,这些模型在多个合成数据集上进行训练,并采用不同的训练目标。我们发现,虽然其他目标(如序列到序列建模、前缀语言建模)往往未能引发层次化泛化,但采用语言建模目标训练的模型始终能够学习进行层次化泛化。随后,我们进行修剪实验以研究变换器在何种情况下编码层次结构。当进行修剪后,我们发现模型中存在具有不同泛化行为的子网络(对应层次结构和线性次序的子网络)。最后,我们从贝叶斯视角进一步揭示变换器对层次化泛化的偏好:我们建立了变换器在数据集上是否进行层次化泛化与该数据集最简单解释是否由层次化语法(相对于 exhibiting 线性泛化的正则语法)提供之间的相关性。
引用
@article{arxiv.2404.16367,
title = {Learning Syntax Without Planting Trees: Understanding Hierarchical Generalization in Transformers},
author = {Kabir Ahuja and Vidhisha Balachandran and Madhur Panwar and Tianxing He and Noah A. Smith and Navin Goyal and Yulia Tsvetkov},
journal= {arXiv preprint arXiv:2404.16367},
year = {2025}
}
备注
Accepted in TACL Code now available: https://github.com/kabirahuja2431/transformers-hg