基于 Transformer 的语言模型中平移不变自注意力之辩
计算与语言
2021-06-04 v1 人工智能
机器学习
摘要
编码位置信息的机制是基于 transformer 的语言模型的核心。本文中,我们分析现有语言模型的位置嵌入,发现无论是嵌入本身还是其对自注意力的影响,都存在强烈的平移不变性证据。平移不变性程度在训练过程中增强,并与模型性能正相关。我们的发现促使我们提出平移不变自注意力(TISA),它以可解释的方式考虑词元间的相对位置,而无需常规的位置嵌入。相较于现有的位置表示方案,我们的提案具有若干理论优势。实验表明,在 GLUE 任务上它优于常规 ALBERT,而仅增加了数量级远小的位置参数。
引用
@article{arxiv.2106.01950,
title = {The Case for Translation-Invariant Self-Attention in Transformer-Based Language Models},
author = {Ulme Wennberg and Gustav Eje Henter},
journal= {arXiv preprint arXiv:2106.01950},
year = {2021}
}
备注
11 pages, 8 figures, Accepted to ACL 2021