将 Llama-3 的上下文长度 overnight 扩展为原来的十倍
计算与语言
2024-05-01 v1
摘要
我们通过 QLoRA 微调将 Llama-3-8B-Instruct 的上下文长度从 8K 扩展至 80K。整个训练周期高效且快速,在单台配备 8 块 80G A800 GPU 的机器上仅需 8 小时。得到的模型在广泛的评估任务中表现优异,包括 NIHS、主题检索和长上下文语言理解;同时也能很好地保持原始在短上下文上的能力。这种显著的上下文扩展主要归功于仅生成的 3.5K 个由 GPT-4 生成的合成训练样本,表明大语言模型固有的(尽管被严重低估的)潜力足以扩展其原始上下文长度。事实上,上下文长度甚至可以进一步超过 80K。因此,该团队将公开发布全部资源(包括数据、模型、数据生成管道、训练代码),以便社区未来研究使用:\url{https://github.com/FlagOpen/FlagEmbedding}。
引用
@article{arxiv.2404.19553,
title = {Extending Llama-3's Context Ten-Fold Overnight},
author = {Peitian Zhang and Ninglu Shao and Zheng Liu and Shitao Xiao and Hongjin Qian and Qiwei Ye and Zhicheng Dou},
journal= {arXiv preprint arXiv:2404.19553},
year = {2024}
}