中文

RegionMed-CLIP:面向医学图像理解的区域感知多模态对比学习预训练模型

计算机视觉与模式识别 2025-09-22 v2 人工智能

摘要

医学图像理解在实现自动诊断和数据驱动的临床决策支持方面发挥着关键作用。然而,其进展受到两个主要挑战的制约:高质量标注医学数据的可得性有限,以及过度依赖全局图像特征,这些特征常常忽略了临床上关键的病灶区域。为此,我们引入RegionMed-CLIP,一种区域感知多模态对比学习框架,显式地将局部病灶信号与整体语义表示结合。我们方法的核心是一种创新的区域感兴趣(ROI)处理器,可适配性地整合细粒度区域特征与全局语境,并受益于增强层次化多模态对齐的渐进式训练策略。为实现大规模区域级别表示学习,我们构建了MedRegion-500k,一个包含大量区域标注和多层次临床描述的全面医学图像文本语料库。在图像文本检索、零样本分类和视觉问答任务上的广泛实验表明,RegionMed-CLIP consistently exceed state-of-the-art vision language models by a wide margin。我们的结果突显了区域感知对比预训练的关键重要性,并将RegionMed-CLIP定位为推进多模态医学图像理解的稳健基础。

关键词

引用

@article{arxiv.2508.05244,
  title  = {RegionMed-CLIP: A Region-Aware Multimodal Contrastive Learning Pre-trained Model for Medical Image Understanding},
  author = {Tianchen Fang and Guiru Liu},
  journal= {arXiv preprint arXiv:2508.05244},
  year   = {2025}
}

备注

Upon further review, we identified that our dataset requires optimization to ensure research reliability and accuracy. Additionally, considering the target journal's latest submission policies, we believe comprehensive manuscript revisions are necessary