中文

VeriThinker: 通过验证学习的推理模型效率提升

机器学习 2025-05-26 v1

摘要

大型推理模型(Large Reasoning Models, LRMs)在复杂任务中运用链式思考(Chain-of-Thought, CoT)推理方面表现卓越。然而,这些模型倾向于过度思考,导致推理链不必要地冗长,显著增加推理成本。为缓解此问题,我们引入VeriThinker,一种新的CoT压缩方法。不同于直接使用合成简洁CoT数据对原始推理任务进行微调的常规方法,我们创新性地仅通过辅助验证任务进行微调。通过训练LRMs准确验证CoT解答的正确性,LRMs本质上会对后续自我反思步骤的必要性更加判断,从而有效抑制过度思考。大量实验验证了VeriThinker在保持或略微提升准确率的同时,显著缩短了推理链长度。当应用于DeepSeek-R1-Distill-Qwen-7B时,我们的方法将MATH500上的推理token数从3790降至2125,准确率提升0.8%(从94.0%提升至94.8%);在AIME25上,token数从14321降至10287,准确率提升2.1%(从38.7%提升至40.8%)。此外,我们的实验表明,VeriThinker还能对推测性推理实现零样本泛化。代码已公开于https://github.com/czg1225/VeriThinker

关键词

引用

@article{arxiv.2505.17941,
  title  = {VeriThinker: Learning to Verify Makes Reasoning Model Efficient},
  author = {Zigeng Chen and Xinyin Ma and Gongfan Fang and Ruonan Yu and Xinchao Wang},
  journal= {arXiv preprint arXiv:2505.17941},
  year   = {2025}
}

备注

Working in progress. Code Repo: https://github.com/czg1225/VeriThinker