RoPE 在长上下文中既不能区分位置也不能区分标记,形式地证明了这一点
计算与语言
2026-05-18 v1 人工智能
机器学习
摘要
我们识别了旋转位置嵌入(RoPE)在基于Transformer的长上下文语言模型中的内在局限性。我们的理论分析抽象化了上下文内容,仅依赖于其长度。我们证明,随着上下文长度的增加,RoPE-based注意力变得不可预测,丧失两个对其有效性至关重要的属性。首先,它丧失了局部性偏好:RoPE不再倾向于更近的位置而非显著更远的位置。其次,它丧失了标记相关性的一致性:接收更高注意力得分的关键向量在另一个位置上可能接收更低的得分。在这两种情况下,失败概率接近0.5,不如随机猜测好。我们进一步证明,注意力得分在将关键标记移动到不同位置,甚至替换为不同标记时,得分可以保持不变,表明其未能区分位置或标记。调整RoPE基准可以在区分位置和区分标记之间进行权衡,但无法同时保留两者。增加RoPE基线超参数是今天长上下文模型中常见的做法,能帮助区分不同标记,但不可避免地牺牲了区分位置的能力。我们的实证分析显示,多头、多层架构不足以克服这些局限性。我们的发现表明,未来的Transformer长上下文语言模型可能需要新的机制来编码位置和标记顺序。
引用
@article{arxiv.2605.15514,
title = {RoPE Distinguishes Neither Positions Nor Tokens in Long Contexts, Provably},
author = {Yufeng Du and Phillip Harris and Minyang Tian and Eliu A Huerta and Srikanth Ronanki and Subendhu Rongali and Aram Galstyan and Hao Peng},
journal= {arXiv preprint arXiv:2605.15514},
year = {2026}
}
备注
35 pages, 11 figures, submitted to NeurIPS 2026