CA-GCL:面向稳健 3D 医学图像理解的跨解剖全局-局部对比学习
计算机视觉与模式识别
2026-05-14 v1
摘要
细粒度视觉-语言预训练(FVLP)在 3D 医学图像理解中显示出巨大的潜力,通过将解剖级别的视觉表征与相应的文本描述对齐。然而,现有的 FVLP 范式常常 suffer from 严重的表示塌陷,其文本嵌入空间中,来自不同解剖结构的文本嵌入高度聚集且难以区分。这种分布性退化使模型对提示变体极其敏感,阻碍了可靠的临床部署。为此,我们提出一种新的 Cross-Anatomy Global-Local Contrastive Learning 框架(CA-GCL)。CA-GCL 引入全局对比目标,以强制解剖类别在潜在空间中的分离,有效抵消了局部对齐所导致的聚集倾向。此外,我们纳入基于排列不变性和部分完整性的临床感知文本增强策略,以提高对描述不完整性的鲁棒性。对 CT-RATE 和 Rad-ChestCT 数据集上的广泛评估表明,CA-GCL 在零样本异常检测中 consistently 超过现有的 VLP 范式,实现了卓越的性能,同时表现出强大的跨数据集泛化。关键的是,CA-GCL 减少了各种提示模板之间的性能方差,将 collapsed 的文本相似度分布转化为钟形分布。这些结果验证了 CA-GCL 作为稳健 3D 医学图像理解的有效框架。
引用
@article{arxiv.2605.13544,
title = {CA-GCL: Cross-Anatomy Global-Local Contrastive Learning for Robust 3D Medical Image Understanding},
author = {Hanwen Zhang and Yao Liu and Die Dai and Jiaye Yang and Qiao Liu and Yutong Xie and Peng Wang},
journal= {arXiv preprint arXiv:2605.13544},
year = {2026}
}