LongQLoRA:扩展大语言模型上下文长度的高效有效方法
计算与语言
2023-11-10 v2 人工智能
摘要
我们提出 LongQLoRA,一种以更少训练资源扩展大语言模型上下文长度的高效有效方法。LongQLoRA 结合了 Position Interpolation、QLoRA 和 LongLoRA 的 Shift Short Attention 的优势。使用单块 32GB V100 GPU,LongQLoRA 可以在 1000 步微调内将 LLaMA2 7B 和 13B 的上下文长度从 4096 扩展到 8192,甚至到 12k。LongQLoRA 在 PG19 和 Proof-pile 数据集上取得了有竞争力的困惑度性能,我们的模型优于 LongLoRA,并且在 8192 的评估上下文长度内非常接近 MPT-7B-8K。我们收集并构建了 39k 长指令数据,将 Vicuna-13B 的上下文长度从 4096 扩展到 8192,并在长上下文和短上下文生成任务中均取得良好性能。我们还做了一些消融实验来研究 LoRA rank、微调步数和推理中注意力模式的影响。模型权重、训练数据和代码可在 https://github.com/yangjianxin1/LongQLoRA 获取。
引用
@article{arxiv.2311.04879,
title = {LongQLoRA: Efficient and Effective Method to Extend Context Length of Large Language Models},
author = {Jianxin Yang},
journal= {arXiv preprint arXiv:2311.04879},
year = {2023}
}