3D-RAD:基于多时间分析和多样化诊断任务的综合性 3D Radiology Med-VQA 数据集
计算机视觉与模式识别
2025-10-28 v2
摘要
医学视觉问答 (Med-VQA) 在临床决策支持方面具有重要潜力,但现有工作主要聚焦于 2D 成像且任务多样性有限。本文提出了 3D-RAD 数据集,旨在推动 3D Med-VQA 使用放射科 CT 扫描。3D-RAD 数据集涵盖六种多样化 VQA 任务:异常检测、图像观察、医学计算、存在检测、静态时间诊断和纵向时间诊断。它支持开放式和封闭式问题,引入复杂推理挑战,包括计算任务和多阶段时间分析,以实现全面基准测试。广泛的评估表明,现有视觉-语言模型 (VLMs),尤其是医学 VLMs 在多时间任务中的泛化能力有限,凸显了现实世界 3D 诊断推理的挑战。为推动未来进展,我们发布了 3D-RAD-T 的高质量训练集,包含 136,195 个专业对齐样本,显示在该数据集上进行微调可显著提升模型性能。我们的数据集和代码旨在催化多模态医学 AI 研究,为 3D 医学视觉理解奠定坚实基础,已在 https://github.com/Tang-xiaoxiao/3D-RAD 公开。
引用
@article{arxiv.2506.11147,
title = {3D-RAD: A Comprehensive 3D Radiology Med-VQA Dataset with Multi-Temporal Analysis and Diverse Diagnostic Tasks},
author = {Xiaotang Gai and Jiaxiang Liu and Yichen Li and Zijie Meng and Jian Wu and Zuozhu Liu},
journal= {arXiv preprint arXiv:2506.11147},
year = {2025}
}
备注
Accepted by NeurIPS 2025