LLM 与 VLM 的递归思考-回答过程
计算与语言
2026-03-04 v2
摘要
思考-回答类推理器(如DeepSeek-R1)通过利用可解释的内部推理取得了显著进展。然而,尽管自反省线索(如"Oops!")频繁出现,单次推理过程仍易产生错误。为此,我们提出一种高效的递归思考-回答过程(Recursive Think-Answer Process, R-TAP),使模型能够进行迭代推理循环并生成更准确的答案,超越传统单次传递方法。核心在于引入置信度生成器,评估模型响应的确定性并指导后续改进。通过纳入两种互补奖励——递归置信度提升奖励(Recursively Confidence Increase Reward)和最终答案置信度奖励(Final Answer Confidence Reward),我们展示,R-TAP增强的模型在大型语言模型(LLM)和视觉语言模型(VLM)方面均显著优于传统单次传递方法。此外,通过分析"Oops"等自反省表述在模型响应中的频率,我们发现应用R-TAP的模型呈现出显著更少的自反省模式,导致推理过程更稳定且更快。我们希望R-TAP为未来 AI 的高效深化推理方法之路铺平道路。
引用
@article{arxiv.2603.02099,
title = {Recursive Think-Answer Process for LLMs and VLMs},
author = {Byung-Kwan Lee and Youngchae Chee and Yong Man Ro},
journal= {arXiv preprint arXiv:2603.02099},
year = {2026}
}
备注
CVPR 2026 Findings, Project page: https://litcoderr.github.io/rtap_page/