从 Rope 到 Nope 再返回:一种新的混合注意力策略
计算与语言
2025-10-24 v2
摘要
长上下文大语言模型 (LLM) 取得了显著进展,这些进展驱动了如旋转位置嵌入 (RoPE) (Su 等,2023) 及其延伸 (Chen 等,2023; Liu 等,2024c; Peng 等,2023) 等技术。通过调整 RoPE 参数并 incorporating 包含扩展上下文的训练数据的训练,我们可以训练在输入序列显著延长的情况下仍具表现的模型。然而,现有的 RoPE-based 方法在应用于扩展上下文长度时表现受限。本文对各种注意力机制进行了全面分析,包括 RoPE、无位置嵌入 (NoPE) 和查询-键归一化 (QK-Norm),确定了它们在长上下文建模中的优势与不足。我们的研究识别了这些方法中独特的注意力模式,并突显了它们对长上下文性能的影响,为架构设计提供了宝贵的见解。基于这些发现,我们提出一种新型架构,特点是集成全局和局部注意力跨度的混合注意力机制。该设计不仅在长和短上下文任务中超越基于全注意力的常规 RoPE-based Transformer 模型,还在训练和推理中实现显著的效率提升。
引用
@article{arxiv.2501.18795,
title = {Rope to Nope and Back Again: A New Hybrid Attention Strategy},
author = {Bowen Yang and Bharat Venkitesh and Dwarak Talupuru and Hangyu Lin and David Cairuz and Phil Blunsom and Acyr Locatelli},
journal= {arXiv preprint arXiv:2501.18795},
year = {2025}
}