基于不确定性的自适应测试时推理预算分配
计算与语言
2026-05-27 v1
摘要
抽取多个响应可改善语言模型的推理效果,但均匀的计算分配效率低下:容易的问题被过度抽样,而困难的问题仍不足。我们提出不确定性感知预算分配(UAB),这是一个基于每个问题不确定性(额外推理成本为零)进行的凹整数优化框架,以重新分配固定抽样预算。在阶段 1 中,每个问题接收一次生成,其平均负对数似然(ANLL)直接从输出对数概率中提取,作为难度信号;该生成同时为最终投票贡献。在阶段 2 中,剩余预算通过边际-贪心算法分配,该算法精确求解凹型覆盖最大化替代方案:不确定性强的問題接收更多抽样预算,而自信的問題接收更少的额外抽样。我们在覆盖 1.5B 至 27B 参数的六个开源及闭源模型上,对五个覆盖数学、逻辑与偏好任务的基准进行评估,UAB 在平均准确率上提升最高可达 +3%,个别基准上可达 +5%,在资源有限的情形下获得最大收益,且无需额外模型或额外调用大语言模型。代码已公开于 https://github.com/manhitv/UAB。
引用
@article{arxiv.2605.26849,
title = {Uncertainty-Aware Budget Allocation for Adaptive Test-Time Reasoning},
author = {Manh Nguyen and Sunil Gupta and Hung Le},
journal= {arXiv preprint arXiv:2605.26849},
year = {2026}
}