中文

位置编码对多语言压缩的影响

计算与语言 2021-09-14 v1

摘要

为了在非自回归设置中保留词序信息,Transformer架构倾向于包含位置知识,例如通过将位置编码添加到词嵌入中。针对原始Transformer架构中使用的正弦位置编码,已有若干修改被提出;例如,将位置编码与词嵌入分离,或基于词对之间的距离直接修改注意力权重。我们首先展示了一个令人惊讶的结果:尽管这些修改往往能改进单语言模型,但它们中没有一个能产生更好的多语言模型。然后我们回答了为什么会这样:正弦编码被明确设计为通过允许在任意时间步上进行线性投影来促进组合性。多语言训练分布中更高的方差要求更高的压缩,在这种情况下,组合性变得不可或缺。学习到的绝对位置编码(例如在mBERT中)在多语言设置中倾向于近似正弦嵌入,但更复杂的位置编码架构缺乏有效学习组合性和跨语言对齐的归纳偏置。换言之,虽然正弦位置编码最初是为单语言应用设计的,但它们在多语言模型中尤为有用。

关键词

引用

@article{arxiv.2109.05388,
  title  = {The Impact of Positional Encodings on Multilingual Compression},
  author = {Vinit Ravishankar and Anders Søgaard},
  journal= {arXiv preprint arXiv:2109.05388},
  year   = {2021}
}