基于置信动态的推理时间优化
计算与语言
2026-05-26 v1
摘要
推理时间优化技术,如重复抽样,显著提升了大型语言模型(LLM)的推理能力。然而,这些优化策略中模型不确定性的关键作用仍在很大程度上未被探讨。本文我们考察沿推理轨迹以及首次揭示一个惊人且独特的模式:正确答案的轨迹倾向于随时间提高置信度(正置信增益),而错误轨迹则表现出置信度的减弱或下降。基于此观察,我们提出基于置信动态增益(CDG)的投票方法,纳入响应沿推理链演化的置信度轨迹。在AIME24/25、HMMT25和BRUMO25基准测试中,对四个开源架构(DeepSeek-R1、gpt-oss、Gemma-3、Qwen-QwQ)进行实验,证明CDG相对于基线方法显著提升性能。这些结果表明我们的方法为改进LLM推理中的答案选择提供了稳健的判别信号。我们也提供理论洞察。代码将在 https://github.com/Accenture/CDG.git 发布。
引用
@article{arxiv.2605.25244,
title = {Inference Time Optimization with Confidence Dynamics},
author = {Yu Wang and Minghao Liu and Jiayun Wang and Jinrui Huang and Ankit Shah and Wei Wei},
journal= {arXiv preprint arXiv:2605.25244},
year = {2026}
}
备注
Published in ICML 2026