R1-Compress:基于块压缩与检索的长链条推理压缩
计算与语言
2025-11-14 v2
摘要
链条推理(Chain-of-Thought, CoT)通过启用逐步问题解决功能,提升了大型语言模型(LLM)的表现,但其扩展至长链条推理会因 token 长度增加而造成巨大的计算开销。现有压缩方法——实例级和 token 级——要么牺牲关键局部推理信号(如反思),要么产生不连贯的输出。为此,我们提出 R1-Compress,一个两阶段块级压缩框架,既保留局部信息又保持连贯性。该方法将长链条推理分割为可管理的块,应用 LLM 驱动的块内压缩,并通过块间检索机制选取简短且连贯的序列。实验在 MATH500、AIME24 和 GPQA-Diamond 上进行,采用 Qwen2.5-Instruct 模型测试。结果表明,R1-Compress 在显著降低 token 使用量的同时,保持了可比的推理准确率。在 MATH500 上,R1-Compress 实现 92.4% 的准确率,仅比长链条推理基线下降 0.6%,而 token 使用量约降低 20%。源码将在 https://github.com/w-yibo/R1-Compress 发布。
引用
@article{arxiv.2505.16838,
title = {R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and Search},
author = {Yibo Wang and Haotian Luo and Huanjin Yao and Tiansheng Huang and Haiying He and Rui Liu and Naiqiang Tan and Jiaxing Huang and Xiaochun Cao and Dacheng Tao and Li Shen},
journal= {arXiv preprint arXiv:2505.16838},
year = {2025}
}
备注
Accepted by NeurIPS FoRLM Workshop