一种用于免训练多模态步骤验证的纳什均衡框架
计算机视觉与模式识别
2026-05-20 v1 计算机科学与博弈论
摘要
多模态大语言模型经常生成包含细微错误的推理链,从而导致错误答案。当前的验证方法存在显著局限性。学习型评论家需要大量标记数据,并且在不同任务上表现不一致。同时,现有的免训练方法只是简单地对来自不同来源的分数进行平均,忽略了一个关键见解:当这些分数不一致时,这种不一致本身就携带着关于推理步骤是否真正有效的重要信息。我们提出了一种免训练验证方法,将逐步验证视为专门评判者之间的协调问题。我们将这些评判者的互动形式化为一个纳什均衡博弈,其中一致表示有效步骤,而不一致则揭示了不稳定性。我们的方法通过闭式解计算均衡分数,从而能够实现基于不一致性的过滤和基于稳定性意识的推理步骤排序。在六个基准测试上的评估表明,我们的方法相对于基线模型实现了2.4%到5.2%的一致改进,并表现出与学习型评论器相竞争的性能,证明了跨模态一致性(而不仅仅是平均置信度)无需任务特定适应即可提供稳健的验证信号。
引用
@article{arxiv.2605.20033,
title = {A Nash Equilibrium Framework For Training-Free Multimodal Step Verification},
author = {Rohit Sinha and Kunal Tilaganji and Tanuja Ganu and Nagarajan Natarajan and Amit Sharma and Vineeth N. Balasubramanian},
journal= {arXiv preprint arXiv:2605.20033},
year = {2026}
}
备注
ICLR 2026 Workshop VerifAI-2