更短的思考,相同答案:基于难度缩放的分段强化学习用于链条压缩
人工智能
2026-03-10 v1 机器学习
摘要
链条思考(Chain-of-Thought, CoT)虽然提高了推理可靠性,但增加了 token 成本,因此动机在于对显式推理痕迹进行后训练压缩。然而,最短的充分推理并非通用:它取决于难度、模型容量和训练状态,使得固定长度目标脆弱。实际中,基于简化的 RL 压缩也会不可取地缩短用户可见的答案,因为单个完成级别的学习信号跨越了思考/答案边界。我们提出难度缩放分段 GRPO(DSS-GRPO),该方法将收益分解为思考和答案组件,按段落计算组相对优势,并通过硬 token 掩码将其路由,以便压缩更新仅作用于思考部分,而答案对齐仅作用于答案。DSS-GRPO 使用基于提示的组内形状和难度感知缩放,以鼓励简洁推理,同时避免答案行为崩溃。
引用
@article{arxiv.2603.07598,
title = {Shorter Thoughts, Same Answers: Difficulty-Scaled Segment-Wise RL for CoT Compression},
author = {Ye Tian and Aijun Liu},
journal= {arXiv preprint arXiv:2603.07598},
year = {2026}
}
备注
12 pages, 3 figures. Preprint. Code available at the GitHub project repository