中文

利用极坐标位置嵌入解耦“什么”与“哪里”

机器学习 2025-12-24 v2 人工智能 计算与语言

摘要

Transformer 架构中的注意力机制基于内容(即“什么”)和序列中的位置(即“哪里”)将键匹配到查询。我们提出了一项分析,表明在流行的 RoPE 旋转位置嵌入中,“什么”与“哪里”是纠缠在一起的。当决策需要对这两个因素进行独立匹配时,这种纠缠可能会损害性能。我们提出了一种对 RoPE 的改进,称为极坐标位置嵌入或 PoPE,它消除了“什么-哪里”的混淆。在仅需按位置或按内容进行索引的诊断任务中,PoPE 表现得远为优越。在音乐、基因组和自然语言领域的自回归序列建模中,使用 PoPE 作为位置编码方案的 Transformer 在评估损失(困惑度)和下游任务表现方面均优于使用 RoPE 的基线。在语言建模中,这些增益在模型规模上保持一致,从 124M 到 774M 参数不等。至关重要的是,与 RoPE 甚至专为外推设计且需要额外微调和频率插值的 YaRN 方法相比,PoPE 展现出了强大的零样本长度外推能力。

关键词

引用

@article{arxiv.2509.10534,
  title  = {Decoupling the "What" and "Where" With Polar Coordinate Positional Embeddings},
  author = {Anand Gopalakrishnan and Robert Csordás and Jürgen Schmidhuber and Michael C. Mozer},
  journal= {arXiv preprint arXiv:2509.10534},
  year   = {2025}
}

备注

Comparison to YaRN added + additional bias visualization + model ablation