位置嵌入学到了什么?预训练语言模型位置编码的实证研究
计算与语言
2020-10-13 v1 人工智能
摘要
近年来,预训练的 Transformer 主导了大多数 NLP 基准任务。许多预训练 Transformer 的变体不断出现,且大多聚焦于设计不同的预训练目标或自注意力变体。在自注意力机制中嵌入位置信息也是 Transformer 中不可或缺的因素,然而却常被随意讨论。因此,本文对主流预训练 Transformer 的位置嵌入进行了实证研究,主要关注两个问题:1)位置嵌入是否真正学习了位置的含义?2)这些不同的已学习位置嵌入如何影响 Transformer 处理 NLP 任务?本文聚焦于通过对大多数标志性 NLP 任务的特征级分析和实证实验,提供对预训练位置嵌入的新见解。我们相信,我们的实验结果能够指导未来工作根据应用属性为特定任务选择合适的 positional encoding 函数。
引用
@article{arxiv.2010.04903,
title = {What Do Position Embeddings Learn? An Empirical Study of Pre-Trained Language Model Positional Encoding},
author = {Yu-An Wang and Yun-Nung Chen},
journal= {arXiv preprint arXiv:2010.04903},
year = {2020}
}
备注
Accepted by EMNLP 2020