ReXVQA:面向通用胸部 X 光理解的大规模视觉问答基准
计算机视觉与模式识别
2025-06-06 v1 人工智能
计算工程、金融与科学
计算与语言
机器学习
摘要
我们提出 ReXVQA,目前最全面的胸部放射学视觉问答 (VQA) 基准测试,包含约 69.6 万个问题,涵盖训练、验证和测试集,配有 16 万张胸部 X 光片。与先前依赖模板化查询的工作不同,ReXVQA 引入多样且临床上真实的任务套件,反映五种核心放射学推理技能:存在性评估、位置分析、否定检测、鉴别诊断和几何推理。我们评估了八个最新多模态大语言模型,包括 MedGemma-4B-it、Qwen2.5-VL、Janus-Pro-7B 和 Eagle2-9B。最佳表现模型 (MedGemma) 实现了 83.24% 的总体准确率。为了弥合 AI 性能与临床专家水平之间的差距,我们对 200 例随机抽取的病例进行了全面的人类读者研究,涉及 3 名放射科住院医师。我们的评估显示,MedGemma 的表现 (83.84% 准确率) 在人类读者 (最佳放射科住院医师:77.27% 准确率) 之上,标志着 AI 在胸部 X 光解读中超越专家人类水平的重要里程碑。读者研究揭示了 AI 模型与人类专家之间的不同表现模式,放射科医师之间表现高度一致,而人类读者与 AI 模型之间的一致性更为不稳定。ReXVQA 为评估通用放射学 AI 系统设立了新标准,提供公开排行榜、细粒度评估划分、结构化解释和类别级分解。该基准为能够模仿专家水平临床推理的下一代 AI 系统奠定了基础。我们的数据集将在 https://huggingface.co/datasets/rajpurkarlab/ReXVQA 公开。
引用
@article{arxiv.2506.04353,
title = {ReXVQA: A Large-scale Visual Question Answering Benchmark for Generalist Chest X-ray Understanding},
author = {Ankit Pal and Jung-Oh Lee and Xiaoman Zhang and Malaikannan Sankarasubbu and Seunghyeon Roh and Won Jung Kim and Meesun Lee and Pranav Rajpurkar},
journal= {arXiv preprint arXiv:2506.04353},
year = {2025}
}