Qwen2.5-1M 技术报告
计算与语言
2025-01-28 v1
摘要
我们介绍Qwen2.5-1M,一系列模型将上下文长度扩展至100万token。相较于前128K版本,Qwen2.5-1M系列通过长上下文预训练和后训练显著提升了长上下文能力。关键技术包括长数据合成、渐进式预训练和多阶段监督微调,以有效提升长上下文性能同时降低训练成本。为促进更广泛用户群体对长上下文模型的采用,我们开源了我们的推理框架。该框架包括一种长度外推方法,可在无需额外训练的情况下将模型上下文长度至少扩展4倍,甚至更多。为降低推理成本,我们实现了沉睡注意力方法,结合块化预填充优化用于部署场景,以及稀疏性细化方法以提高精度。此外,我们详细阐述了在推理引擎中的优化,包括内核优化、流水线并行和调度优化,这些显著提升了整体推理性能。通过我们的推理框架,Qwen2.5-1M模型在100万token上下文场景下实现了3倍至7倍的预填充加速。这一框架为使用开源模型开发需要长上下文处理的应用提供了高效且强大的解决方案。Qwen2.5-1M系列目前包括开源模型Qwen2.5-7B-Instruct-1M和Qwen2.5-14B-Instruct-1M,以及API访问模型Qwen2.5-Turbo。评估显示,Qwen2.5-1M模型在长上下文任务中显著提升,同时不损害短上下文场景中的性能。具体而言,Qwen2.5-14B-Instruct-1M模型在长上下文任务中显著优于GPT-4o-mini,支持的上下文长度是其8倍。
关键词
引用
@article{arxiv.2501.15383,
title = {Qwen2.5-1M Technical Report},
author = {An Yang and Bowen Yu and Chengyuan Li and Dayiheng Liu and Fei Huang and Haoyan Huang and Jiandong Jiang and Jianhong Tu and Jianwei Zhang and Jingren Zhou and Junyang Lin and Kai Dang and Kexin Yang and Le Yu and Mei Li and Minmin Sun and Qin Zhu and Rui Men and Tao He and Weijia Xu and Wenbiao Yin and Wenyuan Yu and Xiafei Qiu and Xingzhang Ren and Xinlong Yang and Yong Li and Zhiying Xu and Zipeng Zhang},
journal= {arXiv preprint arXiv:2501.15383},
year = {2025}
}