中文

无位置嵌入的 Transformer 语言模型中潜在位置信息存在于自注意力方差中

计算与语言 2023-05-24 v1

摘要

在 transformer 语言模型中使用位置嵌入已被广泛接受。然而,近期研究对这一嵌入的必要性提出了质疑。我们进一步拓展该探究,证明一个随机初始化且冻结的、不含位置嵌入的 transformer 语言模型,通过自注意力方差的收缩固有地编码了强位置信息。为量化该方差,我们推导了 transformer 层内每一步的底层分布。通过使用完全预训练模型进行经验验证,我们表明方差收缩效应在大量梯度更新后依然存在。我们的发现为舍弃位置嵌入的决定提供了依据,从而有助于更高效的 transformer 语言模型预训练。

关键词

引用

@article{arxiv.2305.13571,
  title  = {Latent Positional Information is in the Self-Attention Variance of Transformer Language Models Without Positional Embeddings},
  author = {Ta-Chung Chi and Ting-Han Fan and Li-Wei Chen and Alexander I. Rudnicky and Peter J. Ramadge},
  journal= {arXiv preprint arXiv:2305.13571},
  year   = {2023}
}

备注

Accepted by ACL 2023