中文

RadGenome-Chest CT:用于胸部 CT 分析的视觉定位视觉语言数据集

计算机视觉与模式识别 2024-04-26 v1

摘要

开发通才基础模型近期在医学人工智能 (AI4Medicine) 领域的研究者中引起了极大关注。开发这些模型的一个关键洞察在于其依赖数据集规模的扩展,这强调了开发跨各种成像模态融合多种监督信号的开源医学图像数据集的需求。在本文中,我们介绍了 RadGenome-Chest CT,这是一个基于 CT-RATE 构建的全面、大规模、区域引导的 3D 胸部 CT 解读数据集。具体而言,我们利用最新强大的通用分割模型和大语言模型,从以下几个方面扩展了原始数据集(来自 20,000 名患者的超过 25,692 个非对比 3D 胸部 CT 体数据和报告): 覆盖 197 个类别的器官级分割掩码,为解读提供中间推理视觉线索;(ii) 665K 多粒度定位报告,其中报告的每个句子都以分割掩码的形式链接到 CT 体数据的相应解剖区域;(iii) 1.3M 定位 VQA 对,其中问题和答案均与参考分割掩码链接,使模型能够将视觉证据与文本解释相关联。验证集中的所有定位报告和 VQA 对均经过人工验证以确保数据集质量。我们相信,RadGenome-Chest CT 能够通过训练模型基于给定分割区域生成文本,显著推进多模态医学基础模型的发展,这是以往相关数据集无法实现的。我们将发布所有分割掩码、定位报告和 VQA 对,以促进该领域的进一步研究与开发。

关键词

引用

@article{arxiv.2404.16754,
  title  = {RadGenome-Chest CT: A Grounded Vision-Language Dataset for Chest CT Analysis},
  author = {Xiaoman Zhang and Chaoyi Wu and Ziheng Zhao and Jiayu Lei and Ya Zhang and Yanfeng Wang and Weidi Xie},
  journal= {arXiv preprint arXiv:2404.16754},
  year   = {2024}
}