Med-GLIP:基于大规模 grounding 数据集的医学语言-图像预训练
计算机视觉与模式识别
2025-11-07 v2 人工智能
摘要
医学图像 grounding 旨在将自然语言短语与医学图像中的特定区域对齐,作为智能诊断、视觉问答(VQA)和自动报告生成(MRG)的基础任务。然而,现有研究受限于模态覆盖有限、注释粗粒度以及缺乏统一、可泛化的 grounding 框架。为此,我们构建了规模为530万区域级注释的大规模医学 grounding 数据集 Med-GLIP-5M,覆盖七种成像模态,涵盖多样解剖结构和病理发现。该数据集支持分割和 grounding 任务,具有层次化区域标签,从器官级边界到细粒度病灶。基于此基础,我们提出 Med-GLIP,一个在 Med-GLIP-5M 上训练的模态感知 grounding 框架。该方法不依赖显式设计的专家模块,而是从多样化训练数据中隐式获得层次化语义理解——能够识别多粒度结构,例如区分肺部与肺炎病灶。广泛实验表明,Med-GLIP 在多个 grounding 基准测试中 consistently 优于最先进的基线方法。此外,将其空间输出集成到下游任务(包括医学 VQA 和报告生成)中,可显著提升性能。我们的数据集将很快公开发布。
引用
@article{arxiv.2508.10528,
title = {Med-GLIP: Advancing Medical Language-Image Pre-training with Large-scale Grounded Dataset},
author = {Ziye Deng and Ruihan He and Jiaxiang Liu and Yuan Wang and Zijie Meng and Songtao Jiang and Yong Xie and Zuozhu Liu},
journal= {arXiv preprint arXiv:2508.10528},
year = {2025}
}