长上下文 LLM 的 RoPE 扩展:从注意力视角的理解
计算与语言
2024-12-13 v3
摘要
使 LLM 处理长文本是当前的研究热点。大多数 LLM 基于旋转位置嵌入 (RoPE) 构建,这是一种流行的位置编码方法。因此,一个显著路径是将在较短文本上训练的 RoPE 外推到更长的文本。大量工作致力于通过扩展 RoPE 的公式来提升外推,但很少有工作尝试全面展示其内在工作原理。在本文中,我们致力于从注意力视角对 RoPE 扩展提供一种直截而及且深入的理解,并在两个基准任务上进行验证。一系列广泛实验揭示了几个有价值的发现:1) 保持注意力模式与预训练长度一致可改善外推;2) 大注意力不确定性导致检索错误;3) 使用更长的持续预训练长度可减少注意力不确定性并显著提升外推。
引用
@article{arxiv.2406.13282,
title = {Understanding the RoPE Extensions of Long-Context LLMs: An Attention Perspective},
author = {Meizhi Zhong and Chen Zhang and Yikun Lei and Xikai Liu and Yan Gao and Yao Hu and Kehai Chen and Min Zhang},
journal= {arXiv preprint arXiv:2406.13282},
year = {2024}
}