中文

短训练,长测试:带线性偏置的注意力实现输入长度外推

计算与语言 2022-04-26 v2

摘要

自 Vaswani 等人 (2017) 引入 transformer 模型以来,一个根本问题尚待解答:模型如何在推理时对比训练时更长的序列实现外推?我们首先表明,仅通过改变位置表示方法即可启用外推,但我们发现当前方法不允许高效外推。因此我们引入一种更简单且更高效的位置方法——带线性偏置的注意力 (ALiBi)。ALiBi 不将位置嵌入加到词嵌入上;而是用与其距离成正比的惩罚来偏置查询-键注意力分数。我们表明,该方法在长度 1024 的输入序列上训练了一个 13 亿参数的模型,可外推至长度 2048 的输入序列,达到与在长度 2048 输入上训练的正弦位置嵌入模型相同的困惑度,但训练快 11% 且少用 11% 内存。ALiBi 对近因的归纳偏置也使其在 WikiText-103 基准上优于多种强位置方法。

关键词

引用

@article{arxiv.2108.12409,
  title  = {Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation},
  author = {Ofir Press and Noah A. Smith and Mike Lewis},
  journal= {arXiv preprint arXiv:2108.12409},
  year   = {2022}
}