M3Ret:通过自监督学习释放零样本多模态医学图像检索能力
计算机视觉与模式识别
2025-09-03 v1 机器学习
摘要
医学图像检索对于临床决策和转化研究至关重要,它依赖于具有判别力的视觉表征。然而,当前的方法仍然碎片化,依赖于针对2D、3D和基于视频的医学数据采用不同的架构和训练策略。这种模态特定的设计阻碍了可扩展性,并抑制了统一表征的发展。为了实现统一学习,我们构建了一个大规模混合模态数据集,包含867,653个医学影像样本,包括2D X光片和超声、RGB内窥镜视频以及3D CT扫描。利用该数据集,我们训练了M3Ret,一个无需任何模态特定定制的统一视觉编码器。它成功地使用生成式(MAE)和对比式(SimDINO)自监督学习(SSL)范式学习到了可迁移的表征。我们的方法在所有单个模态的零样本图像到图像检索任务中均达到了新的最优水平,超越了DINOv3和文本监督的BMC-CLIP等强大基线。更值得注意的是,在没有配对数据的情况下出现了强大的跨模态对齐,并且该模型能够泛化到未见过的MRI任务,尽管在预训练期间从未见过MRI,这证明了纯视觉自监督学习对未见模态的泛化能力。全面的分析进一步验证了我们框架在模型和数据规模上的可扩展性。这些发现为医学影像社区传递了一个有希望的信号,将M3Ret定位为迈向多模态医学图像理解中视觉自监督学习基础模型的一步。
引用
@article{arxiv.2509.01360,
title = {M3Ret: Unleashing Zero-shot Multimodal Medical Image Retrieval via Self-Supervision},
author = {Che Liu and Zheng Jiang and Chengyu Fang and Heng Guo and Yan-Jie Zhou and Jiaqi Qu and Le Lu and Minfeng Xu},
journal= {arXiv preprint arXiv:2509.01360},
year = {2025}
}
备注
Technical Report