中文

通过聚焦中部的位姿编码实现长上下文扩展的高效方案

计算与语言 2024-10-11 v2

摘要

近期,许多方法被开发用于扩展预训练大语言模型(LLMs)的上下文长度,但它们通常需要在目标长度(4K\gg4K)进行微调,并且难以有效利用上下文中间部分的信息。为解决这些问题,我们提出C\textbf{C}ontinuity-R\textbf{R}elativity indE\textbf{E}xing with gA\textbf{A}ussian M\textbf{M}iddle(CREAM\texttt{CREAM}),该方法通过操作位置索引来插值位置编码。除了简单之外,CREAM\texttt{CREAM} 还具有训练高效性:它仅需在预训练上下文窗口(例如 Llama 2-4K)上进行微调,即可将 LLMs 扩展到更长的目标上下文长度(例如 256K)。为确保模型更关注中间部分的信息,我们引入截断高斯分布,以鼓励在微调期间从上下文中间部分采样,从而缓解长上下文 LLMs 面临的“中间迷失”问题。实验结果表明,CREAM\texttt{CREAM} 成功地将 Llama2-7B\texttt{Llama2-7B} 的基础版和聊天版 LLMs 扩展到目标长度,且“从未错过节拍”。我们的代码已在 https://github.com/bigai-nlco/cream 公开。

关键词

引用

@article{arxiv.2406.07138,
  title  = {An Efficient Recipe for Long Context Extension via Middle-Focused Positional Encoding},
  author = {Tong Wu and Yanpeng Zhao and Zilong Zheng},
  journal= {arXiv preprint arXiv:2406.07138},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024