中文

长上下文 LLM 的 RoPE 扩展:从注意力视角的理解

计算与语言 2024-12-13 v3

摘要

使 LLM 处理长文本是当前的研究热点。大多数 LLM 基于旋转位置嵌入 (RoPE) 构建,这是一种流行的位置编码方法。因此,一个显著路径是将在较短文本上训练的 RoPE 外推到更长的文本。大量工作致力于通过扩展 RoPE 的公式来提升外推,但很少有工作尝试全面展示其内在工作原理。在本文中,我们致力于从注意力视角对 RoPE 扩展提供一种直截而及且深入的理解,并在两个基准任务上进行验证。一系列广泛实验揭示了几个有价值的发现:1) 保持注意力模式与预训练长度一致可改善外推;2) 大注意力不确定性导致检索错误;3) 使用更长的持续预训练长度可减少注意力不确定性并显著提升外推。

关键词

引用

@article{arxiv.2406.13282,
  title  = {Understanding the RoPE Extensions of Long-Context LLMs: An Attention Perspective},
  author = {Meizhi Zhong and Chen Zhang and Yikun Lei and Xikai Liu and Yan Gao and Yao Hu and Kehai Chen and Min Zhang},
  journal= {arXiv preprint arXiv:2406.13282},
  year   = {2024}
}