中文

加速慢思考:基于步骤熵压缩 LLM 链律推理

人工智能 2026-02-17 v2

摘要

大型语言模型(LLM)通过链律推理(Chain-of-Thought, CoT)提示在复杂推理方面表现突出,但会生成冗长且冗余的思考过程,导致推理成本增加和效率下降。我们引入一种基于步骤熵的 novel CoT 压缩框架。步骤熵度量衡量单个推理步骤对整体推理贡献的资讯量,以此识别冗余环节。通过理论分析和广泛的实证验证(基于数学推理基准),我们证明低熵步骤确实高度冗余。实验显示,高达 80% 的低熵中间步骤可被修剪,几乎不影响最终答案准确率,这在 DeepSeek-R1-7B、14B 和 Qwen3-8B 上均成立。该发现与随机或高熵修剪形成鲜明对比,后者严重损害推理性能。基于此,我们提出一种新颖的两阶段训练策略,结合监督微调(SFT)和群相对政策优化(GRPO)强化学习。该方法使 LLM 能在推理期间通过策略性引入 [SKIP] 标记自主学习生成压缩后的链律推理。本方法显著提升 LLM 推理效率,同时保持准确率,为更可扩展的 LLM 部署及对其内部推理机制的更好理解奠定了基础。代码与数据已发布于 https://github.com/staymylove/COT_Compresstion_via_Step_entropy。

关键词

引用

@article{arxiv.2508.03346,
  title  = {Making Slow Thinking Faster: Compressing LLM Chain-of-Thought via Step Entropy},
  author = {Zeju Li and Jianyuan Zhong and Ziyang Zheng and Xiangyu Wen and Zhijian Xu and Yingying Cheng and Fan Zhang and Qiang Xu},
  journal= {arXiv preprint arXiv:2508.03346},
  year   = {2026}
}

备注

Accepted by ICLR2026