Transformer 对支配关系了解多少?
计算与语言
2024-04-23 v1 机器学习
摘要
本文研究从 Transformer 语言模型的编码中可以获得关于语言特征的哪些见解以及关于自然语言结构的哪些知识。特别地,我们探索 BERT 如何编码句子中成分之间的支配关系。我们使用几个探测分类器,以及来自两种形态丰富语言的数据。我们的实验表明,关于支配的信息在所有 Transformer 层中都有编码,但主要分布在模型的早期层。我们发现,对于两种语言,少量的注意力头编码了足够多的关于支配关系的信息,使我们能够训练一个分类器,能够发现新的、以前未知的支配类型,这些类型在训练数据中从未见过。目前,研究语法结构(特别是支配关系)的社区缺乏数据。我们发布了 Government Bank——一个定义了实验中语言中数千个词元的支配关系的数据集。
引用
@article{arxiv.2404.14270,
title = {What do Transformers Know about Government?},
author = {Jue Hou and Anisia Katinskaia and Lari Kotilainen and Sathianpong Trangcasanchai and Anh-Duc Vu and Roman Yangarber},
journal= {arXiv preprint arXiv:2404.14270},
year = {2024}
}