Giraffe:扩展大语言模型上下文长度的探索
人工智能
2023-08-22 v1 计算与语言
摘要
现代依赖注意力机制的大语言模型(LLMs)通常在固定上下文长度下训练,这强制限制了它们在评估时可处理的输入序列长度上限。要在长于训练时上下文长度的序列上使用这些模型,可采用不断壮大的上下文长度外推方法族中的技术——其中大多数侧重于修改注意力机制中使用的位置编码系统,以指示词元或激活在输入序列中的位置。我们在基础的 LLaMA 或 LLaMA 2 模型上对现有的上下文长度外推方法进行了广泛调研,并引入了我们自己的一些设计——特别是用于修改位置编码基的新截断策略。我们使用三个新的评估任务(FreeFormQA、AlteredNumericQA 和 LongChat-Lines)以及困惑度测试这些方法,发现困惑度作为 LLM 长上下文性能的度量不够精细。我们在 HuggingFace 上公开发布了这三个任务作为数据集。我们发现线性缩放是扩展上下文长度的最佳方法,并表明在评估时使用更长的缩放尺度可取得进一步提升。我们还发现了截断基中颇具前景的外推能力。为支持该领域的进一步研究,我们发布了三个新的 13B 参数长上下文模型,称之为 Giraffe:从基础 LLaMA-13B 训练的 4k 和 16k 上下文模型,以及从基础 LLaMA2-13B 训练的 32k 上下文模型。我们也发布了复现我们结果的代码。
引用
@article{arxiv.2308.10882,
title = {Giraffe: Adventures in Expanding Context Lengths in LLMs},
author = {Arka Pal and Deep Karkhanis and Manley Roberts and Samuel Dooley and Arvind Sundararajan and Siddartha Naidu},
journal= {arXiv preprint arXiv:2308.10882},
year = {2023}
}