VinDr-CXR-VQA: 用于可解释胸部X光分析的多任务学习视觉问答数据集
计算机视觉与模式识别
2025-11-11 v2
摘要
我们提出了VinDr-CXR-VQA,一个用于具有空间定位的可解释医学视觉问答的大规模胸部X光数据集。该数据集包含4,394张图像上的17,597个问答对,每个问答对都附有放射科医生验证的边界框和临床推理解释。我们的问题分类涵盖六种诊断类型——哪里、什么、是否有、多少个、哪个和是否——捕捉不同的临床意图。为了提高可靠性,我们构建了41.7%阳性样本和58.3%阴性样本的平衡分布,减少了正常情况下的幻觉。使用MedGemma-4B-it进行的基准测试展示了改进的性能(F1 = 0.624,比基线提高11.8%),同时实现了病灶定位。VinDr-CXR-VQA旨在推进可重复且具有临床基础的医学视觉问答研究。该数据集和评估工具可在huggingface.co/datasets/Dangindev/VinDR-CXR-VQA公开获取。
引用
@article{arxiv.2511.00504,
title = {VinDr-CXR-VQA: A Visual Question Answering Dataset for Explainable Chest X-Ray Analysis with Multi-Task Learning},
author = {Dang H. Nguyen and Hieu H. Pham and Hao T. Nguyen and Hieu H. Pham},
journal= {arXiv preprint arXiv:2511.00504},
year = {2025}
}
备注
ISBI submission. Contains 5 pages, 2 figures, and 6 tables. Code & data: https://huggingface.co/datasets/Dangindev/VinDR-CXR-VQA