MedTrinity-25M:用于医疗的大规模多模态数据集,具有多粒度注释
计算机视觉与模式识别
2025-07-11 v3
摘要
本文介绍了 MedTrinity-25M,这是一个覆盖超过 2500 万张医学图像的综合性大规模多模态数据集,包含 10 种模态类型,针对超过 65 种疾病进行多粒度注释。这些多粒度注释包括全局信息,如模态和器官检测,以及局部信息,如 ROI 分析、病灶纹理和区域相关性。与现有多模态数据集不同的是,后者受限于图像-文本对的可用性。我们开发了第一个自动化管道,通过生成图像-ROI-描述三元组来规模化多模态数据,而无需任何配对文本描述。具体而言,收集、预处理并使用基于领域的专家模型对来自 30 多个不同来源的数据进行了 grounding,以识别与异常区域相关的 ROI。我们随后构建了全面的知识库,并利用所识别的 ROI 作为指导,使用检索增强生成式语言模型进行多粒度文本描述的生成。与现有数据集相比,MedTrinity-25M 提供了最丰富的注释,支持诸如描述生成和报告生成等多模态任务,以及面向视觉的任务,如分类和分割。我们提出了 LLaVA-Tri,通过在 MedTrinity-25M 上预训练 LLaVA,实现了在 VQA-RAD、SLAKE 和 PathVQA 上的最先进性能,超越了代表性的 SOTA 多模态大语言模型。此外,MedTrinity-25M 也可用于支持大规模多模态医学 AI 模型的预训练,为医疗领域未来基础模型的发展做出贡献。我们将公开本数据集。
关键词
引用
@article{arxiv.2408.02900,
title = {MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine},
author = {Yunfei Xie and Ce Zhou and Lang Gao and Juncheng Wu and Xianhang Li and Hong-Yu Zhou and Sheng Liu and Lei Xing and James Zou and Cihang Xie and Yuyin Zhou},
journal= {arXiv preprint arXiv:2408.02900},
year = {2025}
}
备注
The dataset is publicly available at https://yunfeixie233.github.io/MedTrinity-25M/. Accepted to ICLR 2025