超越准确率:多模态医学推理中的视觉 grounding 评估
计算机视觉与模式识别
2026-03-05 v1
摘要
最近的研究表明,仅基于文本的强化学习与可验证奖励(RLVR)在多模态医学 VQA 数据集上可以匹配或超越图像-文本 RLVR,这表明当前的评估协议可能未能衡量因果视觉依赖性。我们引入一个反事实评估框架,使用真实图像、空白图像和混合图像,对四个医学 VQA 数据集(PathVQA、PMC-VQA、SLAKE 和 VQA-RAD)进行测试。除准确率外,我们测量视觉依赖得分(VRS)、图像灵敏度(IS),并提出幻觉视觉推理率(HVRR)以检测模型在生成不依赖图像的答案时仍发表视觉主张的情况。我们的发现表明,RLVR 在提高准确率的同时削弱了视觉 grounding:文本-only RLVR 在 PathVQA 上实现负的 VRS(-0.09),表现出对不匹配图像的更好表现;而图像-文本 RLVR 则将图像灵敏度降低至 39.8% 尽管提升了准确率。在 VQA-RAD 上,两种变体均达到 63% 的准确率,但实现方式不同:文本-only RLVR 在空白图像上保留 81% 的性能,而图像-文本 RLVR 仅显示 29% 的图像灵敏度。模型在 68-74% 的回复中会生成视觉主张,但有 38-43% 是无依据的(HVRR)。这些发现表明,仅凭准确率奖励会导致模型捪取短 cut,而进步需要 grounding-aware 评估协议和强制执行视觉依赖的训练目标。
引用
@article{arxiv.2603.03437,
title = {Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning},
author = {Anas Zafar and Leema Krishna Murali and Ashish Vashist},
journal= {arXiv preprint arXiv:2603.03437},
year = {2026}
}
备注
12 pages, 2 figures, 2 tables, medical VQA / multimodal reasoning evaluation