通过位置插值扩展大语言模型的上下文窗口
计算与语言
2023-06-29 v2 人工智能
机器学习
摘要
我们提出位置插值(Position Interpolation, PI),可将基于 RoPE 的预训练 LLM(如 LLaMA 模型)的上下文窗口大小扩展至最多 32768,且只需极少量微调(1000 步以内),同时在各类需要长上下文的任务上展现出强劲的实证结果,包括从 LLaMA 7B 到 65B 的密钥检索、语言建模和长文档摘要。同时,通过位置插值扩展的模型在其原始上下文窗口内的任务上相对较好地保持了质量。为实现这一目标,位置插值将输入位置索引线性下缩以匹配原始上下文窗口大小,而非在外推超出已训练上下文长度,后者可能导致灾难性的高注意力分数,彻底破坏自注意力机制。我们的理论研究表明,插值的上界至少比外推小约 ,进一步证明了其稳定性。通过位置插值扩展的模型保留了原始架构,并可复用大多数已有的优化与基础设施。
引用
@article{arxiv.2306.15595,
title = {Extending Context Window of Large Language Models via Positional Interpolation},
author = {Shouyuan Chen and Sherman Wong and Liangjian Chen and Yuandong Tian},
journal= {arXiv preprint arXiv:2306.15595},
year = {2023}
}
备注
Fix template issues