DrVD-Bench:视觉语言模型在医学图像诊断中像人类医生一样推理吗?
计算机视觉与模式识别
2025-06-02 v1
摘要
视觉语言模型 在自然图像上展现出强大的零样本泛化能力,并在可解释的医学图像分析中显示出初步前景。然而,现有的基准测试并未系统地评估这些模型是真正像临床医生那样推理,还是仅仅模仿表面模式。为了填补这一空白,我们提出了 DrVD-Bench,这是首个用于临床视觉推理的多模态基准测试。DrVD-Bench 包含三个模块:视觉证据理解、推理轨迹评估和报告生成评估,共包含 7,789 个图像-问题对。我们的基准测试涵盖 20 种任务类型、17 个诊断类别以及五种成像模态——CT、MRI、超声、X 射线摄影和病理学。DrVD-Bench 的结构被明确设计为反映从模态识别到病灶识别和诊断的临床推理工作流程。我们对 19 个 VLM 进行了基准测试,包括通用和医学专用、开源和专有模型,并观察到随着推理复杂度的增加,性能急剧下降。虽然一些模型开始展现出类人推理的痕迹,但它们通常仍依赖于捷径相关性,而非基于视觉的理解。DrVD-Bench 提供了一个严格且结构化的评估框架,以指导临床上可信的 VLM 的开发。
引用
@article{arxiv.2505.24173,
title = {DrVD-Bench: Do Vision-Language Models Reason Like Human Doctors in Medical Image Diagnosis?},
author = {Tianhong Zhou and Yin Xu and Yingtao Zhu and Chuxi Xiao and Haiyang Bian and Lei Wei and Xuegong Zhang},
journal= {arXiv preprint arXiv:2505.24173},
year = {2025}
}