中文

EPiC: 通过保持边缘的链步浓缩实现无损推理训练加速

机器学习 2025-06-05 v1

摘要

大型语言模型 (LLM) 在链步监督训练下展现出惊人的推理能力。然而,尤其是从大型推理模型 (LRM) 如 DeepSeek-R1 提炼的链步轨迹,往往较长且冗余,显著增加提炼过程中非推理基础模型学习复制 LRM 推理行为的训练成本。在本工作中,我们研究了链步浓缩以实现资源高效推理训练的问题,旨在修剪链步轨迹中的中间推理步骤(即思考),使模型能够在保持答案准确性和生成连贯推理能力的前提下,对长度缩短的链步数据进行监督训练。我们的理念是链步轨迹通常遵循三个阶段的结构:问题理解、探索和解决方案收敛。通过经验分析,我们发现保留链步轨迹的结构,尤其是问题理解(富含反思线索)和解决方案收敛的最终阶段,足以实现无损推理监督。为此,我们提出了 Edge-Preserving Condensation 方法 EPiC, selectively 保留每个链步轨迹的初始和最终片段,丢弃中间部分。这种设计类比于保留推理轨迹的“边缘”,捕获初始问题表述和最终答案综合,以维持逻辑连续性。跨多个模型家族(Qwen 和 LLaMA)和基准测试的实验表明,EPiC 可将训练时间缩短 34% 以上,同时在 MATH500 上实现无损推理准确率,相当于完整链步监督。到目前为止,这是首个探索思想级别链步浓缩以实现高效推理模型提炼的研究。

关键词

引用

@article{arxiv.2506.04205,
  title  = {EPiC: Towards Lossless Speedup for Reasoning Training through Edge-Preserving CoT Condensation},
  author = {Jinghan Jia and Hadi Reisizadeh and Chongyu Fan and Nathalie Baracaldo and Mingyi Hong and Sijia Liu},
  journal= {arXiv preprint arXiv:2506.04205},
  year   = {2025}
}