中文

基于 Transformer 的语言模型中平移不变自注意力之辩

计算与语言 2021-06-04 v1 人工智能 机器学习

摘要

编码位置信息的机制是基于 transformer 的语言模型的核心。本文中,我们分析现有语言模型的位置嵌入,发现无论是嵌入本身还是其对自注意力的影响,都存在强烈的平移不变性证据。平移不变性程度在训练过程中增强,并与模型性能正相关。我们的发现促使我们提出平移不变自注意力(TISA),它以可解释的方式考虑词元间的相对位置,而无需常规的位置嵌入。相较于现有的位置表示方案,我们的提案具有若干理论优势。实验表明,在 GLUE 任务上它优于常规 ALBERT,而仅增加了数量级远小的位置参数。

关键词

引用

@article{arxiv.2106.01950,
  title  = {The Case for Translation-Invariant Self-Attention in Transformer-Based Language Models},
  author = {Ulme Wennberg and Gustav Eje Henter},
  journal= {arXiv preprint arXiv:2106.01950},
  year   = {2021}
}

备注

11 pages, 8 figures, Accepted to ACL 2021