大语言模型的免训练长上下文扩展
计算与语言
2024-05-30 v2
摘要
当输入 token 数量超过预训练长度时,大语言模型(LLMs)处理和生成连贯文本的能力会显著减弱。鉴于使用更长序列对大规模模型进行微调的昂贵开销,我们提出了双块注意力(Dual Chunk Attention, DCA),它使 Llama2 70B 能够支持超过 100k token 的上下文窗口,而无需持续训练。通过将长序列的注意力计算分解为基于块的模块,DCA 能够有效捕捉同一块内(块内)和不同块之间(块间)token 的相对位置信息,并与 Flash Attention 无缝集成。除了令人印象深刻的外推能力外,DCA 在实际长上下文任务上的表现可与甚至优于微调模型。与专有模型相比,我们的免训练 70B 模型达到了 gpt-3.5-16k 性能的 94%,表明它是一个可行的开源替代方案。本工作中使用的所有代码和数据已在\url{https://github.com/HKUNLP/ChunkLlama}发布。
引用
@article{arxiv.2402.17463,
title = {Training-Free Long-Context Scaling of Large Language Models},
author = {Chenxin An and Fei Huang and Jun Zhang and Shansan Gong and Xipeng Qiu and Chang Zhou and Lingpeng Kong},
journal= {arXiv preprint arXiv:2402.17463},
year = {2024}
}