中文

MedVIGIL: 评估在视觉证据失效情况下的可信医学视觉-语言模型

计算机视觉与模式识别 2026-05-25 v2

摘要

医学视觉-语言模型(VLMs)通常在完整的图像-问题对上进行评估,但可信的临床应用需要更强的属性:模型必须识别答案依据失效时的情况。我们通过研究在证据被扰动情况下的静默失效来展开研究,其中医学问题配对虚假前提、措辞扰动、仅知识改写或ROI被破坏的图像,但模型仍返回流畅的非拒绝答案。我们引入medvigil,一个由四个公开医学VQA来源抽取的300案例评估套件,由四位持证放射科医生全程监督:每个黄金答案、拒绝选项、候选答案集合、改写、虚假前提陷阱、ROI框以及临床风险分层均由医生编写。两位放射科医生并行标注每个案例,资深放射科医生统一发布发布的清单,而另一位与构建无关的放射科医生对每个探针进行答案,以提供人类参考基线。该数据集包含2556个选择题探针、240个反事实三元组、医生裁决的风险分层和可答性标记、ROI框以及配套的开放式变体。我们报告了七个以正确性为条件的审计指标,这些指标汇总为medvigil综合得分(MCS),并审计了16个具备视觉能力的模型以及两个仅文本基线。独立放射科医生得分MCS为83.3,静默失效率为5.8%,距离最强审计模型(Claude Opus 4.7得分为69.2)仍有14.1分的综合余量。该基准和评估工具已公开发布。

关键词

引用

@article{arxiv.2605.07919,
  title  = {MedVIGIL: Evaluating Trustworthy Medical VLMs Under Broken Visual Evidence},
  author = {Hanqi Jiang and Junhao Chen and Mingyu Kang and Hyeokjae Kwon and Yi Pan and Lifeng Chen and Weihang You and Haozhen Gong and Ruiyu Yan and Jinglei Lv and Lin Zhao and Hui Ren and Quanzheng Li and Tianming Liu and Xiang Li},
  journal= {arXiv preprint arXiv:2605.07919},
  year   = {2026}
}