中文

基于RoPE的外推缩放定律

计算与语言 2024-03-14 v2 人工智能

摘要

基于旋转位置嵌入(RoPE)的大语言模型(LLM)的外推能力目前是备受关注的话题。解决LLM外推的主流方法是通过将原始RoPE中θn=100002n/d\theta_n={10000}^{-2n/d}的旋转基10000替换为更大的值,并提供更长的微调文本来修改RoPE。在本工作中,我们首先观察到在预训练上下文长度下使用更小或更大的基微调基于RoPE的LLM,都能显著提升其外推性能。此后,我们提出\textbf{\textit{基于RoPE的外推缩放定律}},一个从周期性视角出发的统一框架,用以描述外推性能与基值以及微调上下文长度之间的关系。在此过程中,我们还通过\textbf{\textit{外推临界维度}}解释了基于RoPE的外推问题的起源。除这些观察与分析外,我们在LLaMA2 7B和13B上仅用16K训练长度实现了长达100万上下文长度的外推。

关键词

引用

@article{arxiv.2310.05209,
  title  = {Scaling Laws of RoPE-based Extrapolation},
  author = {Xiaoran Liu and Hang Yan and Shuo Zhang and Chenxin An and Xipeng Qiu and Dahua Lin},
  journal= {arXiv preprint arXiv:2310.05209},
  year   = {2024}
}

备注

26 pages, 12 figures, Accepted by ICLR 2024