中文

为何任何阶数的自回归模型需要双流注意力:结构-语义权衡

机器学习 2026-02-19 v1 计算与语言

摘要

任何阶数的自回归模型(AO-ARMs)为高效掩码扩散提供了可行路径,使其能够实现本机键值缓存,但迄今为止仍需双流注意力才能实现竞争性能,通常该注意力被证明为解耦标记内容与位置。本文我们认为双流注意力可能发挥更微妙的作用。我们识别出任何阶生成中的结构-语义权衡:每一步的隐藏表示必须同时注意语义信息丰富的标记以进行预测,以及结构上最近的标记以进行总结,这些目标在单一流中争夺注意力容量,但在双流中可以实现专业化。为将此权衡从位置-内容分离中隔离,我们提出了 Decoupled RoPE,对旋转位置嵌入进行修改,以提供目标位置信息而不透露目标内容。Decoupled RoPE 在序列长度较短时表现竞争——此时语义位置与结构位置一致——但随着序列长度增加且两种排序趋于分离而性能下降。这些结果表明,双流注意力的成功不仅仅源于分离位置与内容,更源于规避了任何阶生成固有的深层结构-语义权衡。

关键词

引用

@article{arxiv.2602.16092,
  title  = {Why Any-Order Autoregressive Models Need Two-Stream Attention: A Structural-Semantic Tradeoff},
  author = {Patrick Pynadath and Ruqi Zhang},
  journal= {arXiv preprint arXiv:2602.16092},
  year   = {2026}
}