中文

提升 VQA 可靠性:一种结合自反思与跨模型验证的双重评估方法

计算机视觉与模式识别 2025-12-18 v1 人工智能

摘要

视觉语言模型(VLM)在视觉问答(VQA)中展现了巨大潜力。然而,VLM 易产生幻觉的特性可能导致过度自信但错误的回答,严重削弱了回答的可靠性。为解决此问题,我们提出了用于 VLM 可靠性的双重评估(DAVR)框架,这是一种结合自反思与跨模型验证以进行全面不确定性估计的新颖框架。DAVR 框架采用双路径架构:一条路径利用双重选择器模块,通过融合 VLM 潜在特征与 QA 嵌入来评估响应可靠性;另一路径则部署外部参考模型进行事实交叉核对,以缓解幻觉。在 ICCV-CLVL 2025 的 Reliable VQA Challenge 中评估,DAVR 取得了 39.64 的领先 Φ100\Phi_{100} 分数和 97.22 的 100-AUC,荣获第一名,证明了其在增强 VLM 响应可信度方面的有效性。

关键词

引用

@article{arxiv.2512.14770,
  title  = {Improving VQA Reliability: A Dual-Assessment Approach with Self-Reflection and Cross-Model Verification},
  author = {Xixian Wu and Yang Ou and Pengchao Tian and Zian Yang and Jielei Zhang and Peiyi Li and Longwen Gao},
  journal= {arXiv preprint arXiv:2512.14770},
  year   = {2025}
}