ReCUT: 通过逐步探索路径与偏好优化平衡大语言模型中的推理长度与准确性
计算与语言
2025-06-13 v1
摘要
近期思维链(CoT)提示方法的进展显著提升了大语言模型(LLM)的推理能力。然而,这些方法常因过度推理而导致不必要地冗长或冗余的推理轨迹。现有方法试图通过为训练LLM筛选多条推理链来缓解此问题,但其有效性常受生成数据质量的制约,且容易过拟合。为应对这一挑战,我们提出了推理压缩通过逐步试验(Reasoning Compression ThroUgh Stepwise Trials, ReCUT),一种旨在平衡推理轨迹准确性与长度的新型方法。具体而言,ReCUT采用逐步探索机制与长短切换采样策略,使LLM能够增量式地生成多样化的推理路径。这些路径经过评估后被用于构建偏好对,以训练两个专用模型(Gemini LLMs)——一个针对推理准确性进行优化,另一个针对较短推理进行优化。最终通过插值这两个模型的参数获得一个集成模型。在多个数学推理数据集和骨干模型上的实验结果表明,与各种基线相比,ReCUT将推理长度显著减少约30-50%,同时保持或提升了推理准确性。所有代码和数据将通过 https://github.com/NEUIR/ReCUT 发布。
引用
@article{arxiv.2506.10822,
title = {ReCUT: Balancing Reasoning Length and Accuracy in LLMs via Stepwise Trails and Preference Optimization},
author = {Zhensheng Jin and Xinze Li and Yifan Ji and Chunyi Peng and Zhenghao Liu and Qi Shi and Yukun Yan and Shuo Wang and Furong Peng and Ge Yu},
journal= {arXiv preprint arXiv:2506.10822},
year = {2025}
}