Control-R:迈向可控的测试时扩展
人工智能
2025-06-03 v1 计算与语言
摘要
本文旨在通过引入推理控制场(Reasoning Control Fields, RCF)来解决大型推理模型在长思维链推理中的思考不足与思考过度问题。RCF是一种新颖的测试时方法,从树搜索视角注入结构化控制信号以引导推理。RCF使模型在求解复杂任务时能够根据给定的控制条件调整推理投入。此外,我们提出了Control-R-4K数据集,该数据集由标注有详细推理过程及对应控制场的挑战性问题组成。为进一步增强推理控制能力,我们提出了一种条件蒸馏微调(Conditional Distillation Finetuning, CDF)方法,该方法训练模型——尤其是Control-R-32B——在测试时有效调整推理投入。在AIME2024和MATH500等基准上的实验结果表明,我们的方法在32B规模上实现了SOTA性能,同时实现了可控的长思维链推理过程。总体而言,这项工作引入了一种用于可控测试时扩展推理的有效范式。
引用
@article{arxiv.2506.00189,
title = {Control-R: Towards controllable test-time scaling},
author = {Di Zhang and Weida Wang and Junxian Li and Xunzhi Wang and Jiatong Li and Jianbo Wu and Jingdi Lei and Haonan He and Peng Ye and Shufei Zhang and Wanli Ouyang and Yuqiang Li and Dongzhan Zhou},
journal= {arXiv preprint arXiv:2506.00189},
year = {2025}
}