压缩推理数据在大语言模型后训练中的作用:何时何种方式
人工智能
2026-05-28 v1 机器学习
摘要
大语言模型(LLM)已能通过长链式思维(CoT)推理解决复杂问题,但在性能与 token 成本之间的权衡仍是核心挑战。为此,监督微调(SFT)常采用压缩推理数据,即将 CoT 轨迹缩短为紧凑形式。然而,这种压缩推理数据对后训练效果仍不明了。本文提出 CoT 的分类体系:Explicit CoT 输出所有操作而不做聚合,Composed CoT 将多个操作组合为单一步骤,Implicit CoT 省略中间操作。我们构建一个合成的组合推理任务,允许控制难度、压缩粒度和数据规模,并在不同模型家族和规模下进行全面实验。主要发现:(i)粗糙的 CoT 需要更多 SFT 数据,(ii)与 Explicit CoT 相比,Composed CoT 和 Implicit CoT 在数据规模扩充时受益更大,而 Composed CoT 受数据重复帮助,Implicit CoT 倾向于记忆,(iii)与 SFT 不同,随着可验证奖励的强化学习(RLVR)会分解 SFT 期间学习的压缩步骤,(iv)单向 CoT 排序在更长的序列任务上显示更强的泛化能力。本文的发现为数据资源受限时的 CoT 设计提供了指导,并为理解 LLM 后训练中 SFT 与 RL 的机制提供了重要见解。
引用
@article{arxiv.2605.28008,
title = {Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training},
author = {Kohsei Matsutani and Gouki Minegishi and Takeshi Kojima and Yusuke Iwasawa and Yutaka Matsuo},
journal= {arXiv preprint arXiv:2605.28008},
year = {2026}
}