中文

QwenLong-CPRS:面向 ∞-LLMs 的动态上下文优化

计算与语言 2025-05-28 v2

摘要

本技术报告介绍了 QwenLong-CPRS,一个专为显式长上下文优化设计的上下文压缩框架,旨在解决填充阶段的 prohibitive 计算开销以及大语言模型(LLMs)在长序列处理中的'迷失在中间'性能退化问题。通过一种新颖的动态上下文优化机制实现,QwenLong-CPRS 实现了由自然语言指令引导的多粒度上下文压缩,在提升效率的同时改善了性能。QwenLong-CPRS 源自 Qwen 架构系列,引入了四项关键创新:(1) 自然语言引导的动态优化,(2) 用于增强边界感知的双向推理层,(3) 具有语言建模头的 Token 批评机制,(4) 窗口并行推理。在五个基准测试(4K-2M 词上下文)上的全面评估展示了 QwenLong-CPRS 的三重有效性:(1) 在准确性和效率方面持续优于其他上下文管理方法,如 RAG 和稀疏注意力;(2) 架构无关的集成方式适用于所有旗舰 LLMs,包括 GPT-4o、Gemini 2.0-pro、Claude 3.7-sonnet、DeepSeek-v3 和 Qwen2.5-max,实现了 21.59× 上下文压缩以及 19.15 分的平均性能提升;(3) 与 Qwen2.5-32B-Instruct 配合部署时,QwenLong-CPRS 在 Ruler-128K 和 InfiniteBench 上分别超越领先的专有 LLMs 4.85 分和 10.88 分,建立了新的 SOTA 性能。

关键词

引用

@article{arxiv.2505.18092,
  title  = {QwenLong-CPRS: Towards $\infty$-LLMs with Dynamic Context Optimization},
  author = {Weizhou Shen and Chenliang Li and Fanqi Wan and Shengyi Liao and Shaopeng Lai and Bo Zhang and Yingcheng Shi and Yuning Wu and Gang Fu and Zhansheng Li and Bin Yang and Ji Zhang and Fei Huang and Jingren Zhou and Ming Yan},
  journal= {arXiv preprint arXiv:2505.18092},
  year   = {2025}
}