Transformer中的树:关于Transformer表征树结构能力的理论分析
计算与语言
2021-12-23 v1 机器学习
摘要
Transformer网络是自然语言处理中事实上的标准架构。迄今为止,尚无关于Transformer捕捉树结构能力的理论分析。我们聚焦于Transformer网络学习对树转换问题至关重要的树结构的能力。我们首先分析了标准Transformer架构在给定所有可能树主干(我们将其定义为无标签的树)枚举的情况下学习树结构的理论能力。随后我们证明,两个带ReLU激活函数的线性层可以从任意两个非零、线性独立的起始主干中恢复任意树主干。这意味着Transformer在理论上可以很好地学习树结构。我们使用合成数据进行了实验,发现标准Transformer相较于显式编码树位置信息的Transformer取得了相近的准确率,尽管收敛更慢。这从经验上证实了Transformer能够学习树结构。
引用
@article{arxiv.2112.11913,
title = {Trees in transformers: a theoretical analysis of the Transformer's ability to represent trees},
author = {Qi He and João Sedoc and Jordan Rodu},
journal= {arXiv preprint arXiv:2112.11913},
year = {2021}
}