中文

完成胜于完美:通过结构化多轮分解解锁高效推理

人工智能 2025-06-06 v2

摘要

大型推理模型(LRMs)因推导最终答案的思维链(CoT)过长而备受批评,这导致首Token延迟和整体延迟都很高。通常,LRMs的CoT混合了多个思维单元;每个单元都试图为原始查询生成一个候选答案。因此,提高效率的一个自然想法是减少单元数量。然而,普通CoT中的思维单元无法被显式管理,这使得实现这一想法变得困难。本文引入了多轮分解(MinD),将传统的CoT解码为一系列显式、结构化且轮次式的交互,以弥合这一差距。在MinD中,模型对查询提供多轮响应,其中每一轮包含一个思维单元并产生一个相应的答案。后续轮次可以对先前轮次的思维和答案部分进行反思、验证、修正或探索替代方法。这不仅使答案能够更迅速地交付,还实现了对迭代推理过程的显式控制(即,用户可以在任何轮次暂停或继续)。我们遵循监督微调(SFT)后强化学习(RL)的范式来实现MinD。我们首先通过提示另一个LLM将LRM的输出重新表述为多轮格式,然后用这些数据微调LRM。观察到微调后的模型倾向于消耗比原始模型更多的Token(可能是由于多轮格式引入了额外的答案Token),我们主张利用GRPO等RL算法来优先选择轮次更少的正确输出。在使用R1-Distill模型在MATH数据集上进行训练后,MinD可以在输出Token使用量和首Token时间(TTFT)上实现高达约70%的减少,同时在MATH-500、AIME24、AMC23和GPQA-Diamond等推理基准上保持有竞争力的性能。

关键词

引用

@article{arxiv.2505.19788,
  title  = {Done Is Better than Perfect: Unlocking Efficient Reasoning by Structured Multi-Turn Decomposition},
  author = {Zihao Zeng and Xuyao Huang and Boxiu Li and Hao Zhang and Zhijie Deng},
  journal= {arXiv preprint arXiv:2505.19788},
  year   = {2025}
}