中文

VinDr-CXR-VQA: 用于可解释胸部X光分析的多任务学习视觉问答数据集

计算机视觉与模式识别 2025-11-11 v2

摘要

我们提出了VinDr-CXR-VQA,一个用于具有空间定位的可解释医学视觉问答的大规模胸部X光数据集。该数据集包含4,394张图像上的17,597个问答对,每个问答对都附有放射科医生验证的边界框和临床推理解释。我们的问题分类涵盖六种诊断类型——哪里、什么、是否有、多少个、哪个和是否——捕捉不同的临床意图。为了提高可靠性,我们构建了41.7%阳性样本和58.3%阴性样本的平衡分布,减少了正常情况下的幻觉。使用MedGemma-4B-it进行的基准测试展示了改进的性能(F1 = 0.624,比基线提高11.8%),同时实现了病灶定位。VinDr-CXR-VQA旨在推进可重复且具有临床基础的医学视觉问答研究。该数据集和评估工具可在huggingface.co/datasets/Dangindev/VinDR-CXR-VQA公开获取。

关键词

引用

@article{arxiv.2511.00504,
  title  = {VinDr-CXR-VQA: A Visual Question Answering Dataset for Explainable Chest X-Ray Analysis with Multi-Task Learning},
  author = {Dang H. Nguyen and Hieu H. Pham and Hao T. Nguyen and Hieu H. Pham},
  journal= {arXiv preprint arXiv:2511.00504},
  year   = {2025}
}

备注

ISBI submission. Contains 5 pages, 2 figures, and 6 tables. Code & data: https://huggingface.co/datasets/Dangindev/VinDR-CXR-VQA