何时投票,何时重写:基于不一致引导的测试时扩展策略路由
人工智能
2026-04-30 v1
摘要
大型推理模型(LRMs)在数学推理任务中取得强大的性能,但在具有挑战性的实例上仍然不可靠。现有的测试时扩展方法,如重复抽样、自我纠正和树状搜索,虽在性能提升方面具有效果,但往往在困难问题上 exhibits 递减的报酬。我们观察到,输出不一致与实例难度和预测正确性密切相关,为在测试时引导实例级策略选择提供了有用的信号。基于这一洞察,我们提出了一个无训练框架,将测试时扩展形式化为实例级的路由问题,而不是在单一策略内分配更多计算,动态选择不同扩展策略。该框架对一致情况应用轻量级解决,对中等不一致采用多数投票,对高度模糊的实例采用基于重写的重构。在七个数学基准测试和三个模型上的实验表明,我们的方法在提高准确率 3%~7% 的同时,相较于现有方法还减少了采样成本。
引用
@article{arxiv.2604.26644,
title = {When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling},
author = {Zhimin Lin and Yixin Ji and Jinpeng Li and Yu Luo and Dong Li and Junhua Fang and Juntao Li and Min Zhang},
journal= {arXiv preprint arXiv:2604.26644},
year = {2026}
}