跨模态聚类引导负采样用于医学图像与报告的自我监督联合学习
计算机视觉与模式识别
2025-06-16 v1
摘要
通过多模态自监督学习直接从配对图像和报告学习医学视觉表征,近年来已成为数字诊断的一种新颖高效方法。然而,现有模型存在若干严重局限。1) 忽视负样本的选择,导致困难负样本稀缺且包含虚假负样本;2) 侧重全局特征提取,但忽略了医学图像识别任务至关重要的细粒度局部细节;3) 对比学习主要针对高层特征而忽略了准确医学分析所必需的低层细节。受这些关键问题的启发,本文提出了一种跨模态聚类引导负采样(CM-CGNS)方法,包含双重思路。首先,它将单模态领域中用于局部文本特征的k-means聚类通过跨模态注意力扩展到多模态领域。这一改进增加了负样本数量并增强了模型表征能力。其次,它引入了一种跨模态掩码图像重建(CM-MIR)模块,利用通过跨模态注意力获得的局部文本-图像特征来重建掩码的局部图像区域。该模块显著增强了模型的跨模态信息交互能力,并保留了下游任务所必需的低层图像特征。通过妥善处理上述局限,所提出的CM-CGNS能够学习适用于各种识别任务的有效且鲁棒的医学视觉表征。在五个下游数据集的分类、检测和分割任务上的大量实验结果表明,我们的方法在多项指标上优于最先进方法,验证了其优越性能。
引用
@article{arxiv.2506.11674,
title = {Cross-Modal Clustering-Guided Negative Sampling for Self-Supervised Joint Learning from Medical Images and Reports},
author = {Libin Lan and Hongxing Li and Zunhui Xia and Juan Zhou and Xiaofei Zhu and Yongmei Li and Yudong Zhang and Xin Luo},
journal= {arXiv preprint arXiv:2506.11674},
year = {2025}
}
备注
This work has been submitted to the IEEE TMI for possible publication. Our code is available at https://github.com/violet-42/CM-CGNS