Open-PMC-18M:用于多模态表示学习的高保真大规模医学数据集
计算机视觉与模式识别
2025-12-08 v3
摘要
在生物医学视觉-语言建模中,数据集通常从科学文献中挖掘,将复合图像与简短、依赖上下文且通常仅部分提供信息的标题配对。先前关于子图提取的工作在数据集规模和泛化能力方面均存在局限。此外,现有的工作均未在图文对中融入丰富的医学上下文。我们重新审视数据整理作为有效生物医学表示学习基础组件的作用。我们的数据整理过程集成了基于 Transformer 的子图检测、子标题提取以及源自内联引用的上下文文本丰富化。我们的子图提取模型在 50 万个复合图像的语料库上训练,在真实和合成基准测试中均取得了 SOTA 性能。利用该过程,我们整理并发布了 Open-PMC-18M,这是一个大规模高保真生物医学数据集,包含 1800 万个图文对,涵盖放射学、显微镜和可见光摄影。我们在该数据集上训练了视觉-语言模型,并在三种主要模态的 6 个检索任务和 19 个零样本分类任务上进行了广泛评估。在我们的数据集上训练的模型在医学表示学习中取得了新的 SOTA 结果。我们发布了数据集、模型和代码,以支持可复现的基准测试,并进一步研究生物医学视觉-语言建模与表示学习。
引用
@article{arxiv.2506.02738,
title = {Open-PMC-18M: A High-Fidelity Large Scale Medical Dataset for Multimodal Representation Learning},
author = {Negin Baghbanzadeh and Mohammed Saidul Islam and Sajad Ashkezari and Elham Dolatabadi and Arash Afkanpour},
journal= {arXiv preprint arXiv:2506.02738},
year = {2025}
}
备注
21 pages