ViFP:面向增强视觉-语言模型推理可靠性的视觉假阳性检测框架
计算机视觉与模式识别
2025-11-06 v2 人工智能
摘要
在视觉-语言模型(VLM)的推理过程中,假阳性(FP)推理发生在模型生成正确答案但遵循错误推理路径时,导致推理可靠性受到削弱。现有方法主要依赖提示工程、知识蒸馏或强化学习来提高推理可靠性,这些方法都需要大量高质量数据,从而限制了实际应用。少数方法关注直接检测和纠正 FP。为此,我们提出了 ViFP,一个用于视觉假阳性检测的框架,以增强视觉-语言模型的推理可靠性。ViFP 通过多轮问答构建有效的推理路径,并动态分析推理路径的一致性,以识别潜在的 FP。它还引入了针对性的推理链纠正机制,以修改 FP 推理,从而提高逻辑一致性和准确性。最后,我们引入了一个可靠性评估指标 VoC,将答案准确性和 FP 率整合在内,为评估 VLM 是否不仅准确而且可靠地推理提供了量化工具。我们的实验在闭源 VLM 上表明,ViFP 在三个数据集上均一致改善了性能:A-OKVQA、OK-VQA 和 FVQA。在 A-OKVQA 上,ViFP 将准确率提升了最高 5.4%,超越了前一最先进方法 4.3%,显著减少了 FP 的数量,验证了其在增强推理可靠性方面的益处。
引用
@article{arxiv.2508.04201,
title = {ViFP: A Framework for Visual False Positive Detection to Enhance Reasoning Reliability in VLMs},
author = {Ben Zhang and LuLu Yu and Lei Gao and QuanJiang Guo and Jing Liu and Hui Gao},
journal= {arXiv preprint arXiv:2508.04201},
year = {2025}
}