通过聚焦中部的位姿编码实现长上下文扩展的高效方案
计算与语言
2024-10-11 v2
摘要
近期,许多方法被开发用于扩展预训练大语言模型(LLMs)的上下文长度,但它们通常需要在目标长度()进行微调,并且难以有效利用上下文中间部分的信息。为解决这些问题,我们提出ontinuity-elativity indxing with gussian iddle(),该方法通过操作位置索引来插值位置编码。除了简单之外, 还具有训练高效性:它仅需在预训练上下文窗口(例如 Llama 2-4K)上进行微调,即可将 LLMs 扩展到更长的目标上下文长度(例如 256K)。为确保模型更关注中间部分的信息,我们引入截断高斯分布,以鼓励在微调期间从上下文中间部分采样,从而缓解长上下文 LLMs 面临的“中间迷失”问题。实验结果表明, 成功地将 的基础版和聊天版 LLMs 扩展到目标长度,且“从未错过节拍”。我们的代码已在 https://github.com/bigai-nlco/cream 公开。
引用
@article{arxiv.2406.07138,
title = {An Efficient Recipe for Long Context Extension via Middle-Focused Positional Encoding},
author = {Tong Wu and Yanpeng Zhao and Zilong Zheng},
journal= {arXiv preprint arXiv:2406.07138},
year = {2024}
}
备注
Accepted by NeurIPS 2024