中文

Med-R2:一个用于医学视觉语言模型循证推理的对抗性基准

计算机视觉与模式识别 2026-05-26 v1

摘要

视觉语言模型在通用医学视觉问答中展示了令人印象深刻的能力,但由于可解释性有限,其预测是否反映了基于证据的临床推理还是依赖于虚假先验仍不清楚。我们引入了Med-R2 Bench,这是一个与临床工作流程对齐的分层基准,用于评估具有视觉基础的对抗鲁棒性。我们设计了逐步问答任务,以评估推理链是否严格基于四个临床阶段的视觉证据,并采用对抗性扰动来测试模型对误导性线索的鲁棒性。Med-R2包含42,432张图像、31个任务类别和110,406个问答对。对14个视觉语言模型的评估揭示了沿四阶段临床工作流程的顺序性能退化。对抗性实验表明,模型严重依赖正确的提示来猜测答案。即使提供了明确的视觉线索,模型也难以准确对齐文本描述。最后,我们证明使用我们的分层数据进行逐步微调显著提高了推理鲁棒性,突显了其推动循证医学人工智能未来改进的潜力。

关键词

引用

@article{arxiv.2605.24492,
  title  = {Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs},
  author = {Wen Ma and Fucheng Niu and Zhiting Fan and Zikai Xiao and Jiaxiang Liu and Zuozhu Liu},
  journal= {arXiv preprint arXiv:2605.24492},
  year   = {2026}
}