SurgCheck:视觉语言模型在手术 VQA 中是否真的关注图像?
计算机视觉与模式识别
2026-05-06 v2
摘要
目的:视觉语言模型(VLMs)在手术视觉问答(VQA)中显示出良好的性能,但现有手术 VQA 数据集常包含语言捷径,其中问题措辞隐式限制了答案空间。是否存在报告的性能反映视觉理解,还是依赖于此类语言捷径,尚不明确。方法:我们引入 SurgCheck,一种用于量化语言捷径依赖性的诊断基准。SurgCheck 采用配对问题设计,每幅手术图像关联一个包含实体名称的原问题,以及移除这些名称但保持相同视觉内容和真实答案的较少偏见问题。所得性能差异提供了捷径依赖性的诊断信号。为确保较少偏见的问题即使无实体名称也能明确定义,我们引入四种 grounding 线索:边界框、箭头、空间位置和 periphrasis。我们在 SurgCheck 上评估了通用和手术特定 VLMs,分别在 zero-shot 和 fine-tuned 设置下。为评估开放式 zero-shot 响应,我们引入 LLM-as-a-judge 评估协议。结果:使用 SurgCheck,我们在较少偏见的问题上观察到五个 VLMs 表现 consistently 下降,尽管视觉输入相同。文本-only ablation 揭示,动作和目标预测的性能下降最小,表明动作和目标预测主要由语言捷径驱动而非视觉推理。结论:SurgCheck 提供了一个受控诊断框架,揭示了被语言偏见掩盖的既有手术 VQA 基准的失效模式。我们的发现表明,强基准性能不一定意味着忠实的视觉理解,强调在手术 VQA 中需要敏感偏见的评估。
引用
@article{arxiv.2605.01911,
title = {SurgCheck: Do Vision-Language Models Really Look at Images in Surgical VQA?},
author = {Jongmin Shin and Ka Young Kim and Eunki Cho and Seong Tae Kim and Namkee Oh},
journal= {arXiv preprint arXiv:2605.01911},
year = {2026}
}