RadImageNet-VQA:一个大规模 CT 和 MRI 数据集用于放射学视觉问答
计算机视觉与模式识别
2026-03-31 v2 人工智能
计算与语言
摘要
本工作引入RadImageNet-VQA,一个大规模数据集,旨在推动放射学视觉问答(VQA)在CT和MRI检查上的发展。现有医学VQA数据集在规模上有限,主要以X射线影像或生物医学插图为主,且常受文本基准准则的影响。RadImageNet-VQA由专家校准注释构建,提供75万张图像配对750万个问答样本。数据集覆盖三个关键任务——异常检测、解剖识别和病灶识别——涵盖八个解剖区域和97种病灶类别,支持开放式、封闭式和多选题。广泛实验表明,尽管已有的视觉语言模型在细粒度病灶识别方面仍表现不佳,尤其在开放式设置下,即使在微调后也难以提升。文本分析进一步表明,在没有图像输入的情况下,模型性能会退化到接近随机水平,这确认了RadImageNet-VQA不受语言准则的影响。该完整数据集和基准已在 https://huggingface.co/datasets/raidium/RadImageNet-VQA 上公开。
引用
@article{arxiv.2512.17396,
title = {RadImageNet-VQA: A Large-Scale CT and MRI Dataset for Radiologic Visual Question Answering},
author = {Léo Butsanets and Charles Corbière and Julien Khlaut and Pierre Manceron and Corentin Dancette},
journal= {arXiv preprint arXiv:2512.17396},
year = {2026}
}
备注
Preprint, 33 pages, 15 figures, 11 tables