GEMeX:面向胸部X光诊断的大规模、可 grounding且可解释医学VQA基准
计算机视觉与模式识别
2025-03-25 v2 人工智能
摘要
医学视觉问答(Med-VQA)将计算机视觉和自然语言处理结合,用于自动回答关于医学图像的临床询问。然而,当前的Med-VQA数据集存在两个显著局限性:(1)它们常缺乏对答案的视觉和文本解释,阻碍了患者和初级医生的理解;(2)它们通常提供有限的问答格式,难以充分反映实际场景中的多样化需求。这些局限性对开发可靠且用户友好的Med-VQA系统构成重大挑战。为此,我们引入GEMeX,这是一个大规模、可 grounding且可解释的医学VQA基准,专用于胸部X光诊断,包含多个创新组件:(1)一种多模态可解释性机制,为每个问答对提供详细的视觉和文本解释,从而增强答案的可理解性;(2)四种问答类型:开放式、封闭式、单选和多选,以更好地反映实际需求。GEMeX包含151,025张图像和1,605,575个问题,是目前规模最大的胸部X光VQA数据集。在GEMeX上评估的12个代表性大型视觉语言模型(LVLMs)表现不佳,凸显了数据集的复杂性。同时,我们提出通过在GEMeX训练集上微调现有LVLM所构建的强大模型。显著的性能提升展示了数据集的有效性。该基准可在 https://www.med-vqa.com/GEMeX 获得。
引用
@article{arxiv.2411.16778,
title = {GEMeX: A Large-Scale, Groundable, and Explainable Medical VQA Benchmark for Chest X-ray Diagnosis},
author = {Bo Liu and Ke Zou and Liming Zhan and Zexin Lu and Xiaoyu Dong and Yidi Chen and Chengqiang Xie and Jiannong Cao and Xiao-Ming Wu and Huazhu Fu},
journal= {arXiv preprint arXiv:2411.16778},
year = {2025}
}
备注
This project is available at https://www.med-vqa.com/GEMeX