中文

自回归 Transformer 为何不需要显式位置编码?复盘一块石碑

机器学习 2025-06-03 v2 计算与语言

摘要

自回归 Transformer 语言模型需要显式位置编码(PEs)吗?答案是否定的,只要拥有超过一层——它们可以在没有显式 PEs 的情况下区分序列中被置换的标记。这一属性自早期采用 Transformer 用于语言建模(与 GPT-2 同时期)即为人所知。然而,这一结果似乎没有得到良好传播,导致近期重新发现。这可能部分归因于 GPT-2/3 的出现后语言建模社区的快速增长,但也可能是由于先前工作缺乏清晰的解释,尽管在过去实践者中已被广泛理解。本文我们回顾了为何多层自回归 Transformer(相反,一层模型需要 PEs 来辨识其输入的顺序信息)不需要显式 PEs 的长期被遗忘的解释,以及这一结果的来源,希望重新将其确立为常见知识。

关键词

引用

@article{arxiv.2501.00659,
  title  = {Why Are Positional Encodings Nonessential for Deep Autoregressive Transformers? Revisiting a Petroglyph},
  author = {Kazuki Irie},
  journal= {arXiv preprint arXiv:2501.00659},
  year   = {2025}
}

备注

Accepted to ACL 2025 Findings, Short paper