通过极端比率思维链压缩实现高效大语言推理模型
机器学习
2026-05-26 v4
摘要
思维链推理成功增强了大语言模型的推理能力,但它也为推理带来了大量的计算开销。现有的思维链压缩方法在高压缩比下常常遭受关键的逻辑保真度损失,导致显著的性能下降。为了实现高保真、快速的推理,我们提出了一种新颖的极端比率思维链压缩框架,称为Extra-CoT,它在保持答案准确性的同时,激进地减少令牌预算。为了生成可靠、高保真的监督信号,我们首先在带有细粒度标注的数学思维链数据上训练一个专用的语义保持压缩器。然后,通过混合比率监督微调,在这些压缩对上微调一个大语言模型,教会它遵循一系列压缩预算,并为强化学习提供稳定的初始化。我们进一步提出了约束层次比率策略优化,通过层次化奖励显式地激励在较低预算下的问题求解能力。在三个数学推理基准上的实验显示了Extra-CoT的优越性。例如,在使用Qwen3-1.7B的MATH-500上,Extra-CoT实现了超过73%的令牌缩减,同时准确率提升了0.6%,显著优于最先进的方法。我们的源代码已在https://github.com/Mwie1024/Extra-CoT发布。
引用
@article{arxiv.2602.08324,
title = {Towards Efficient Large Language Reasoning Models via Extreme-Ratio Chain-of-Thought Compression},
author = {Yuntian Tang and Bohan Jia and Wenxuan Huang and Lianyue Zhang and Jiao Xie and Wenxi Li and Wei Li and Jie Hu and Xinghao Chen Rongrong Ji and Shaohui Lin},
journal= {arXiv preprint arXiv:2602.08324},
year = {2026}
}
备注
Accepted to ICML 2026. 15 pages, 7 figures