中文

面向分布迁移下的校准鲁棒基础模型:视觉-语言与医学图像任务

计算机视觉与模式识别 2025-07-22 v2 机器学习

摘要

CLIP、SAM 等基础模型通过零样本迁移学习推动了计算机视觉和医学成像领域的发展,尤其在数据有限的 CADD 场景中发挥作用。然而,其实际部署面临两个关键挑战:分布迁移 (distribution shift) 即预训练和后训练数据分布不同 (例如因中心间图像获取而异),以及置信度错位 (confidence misalignment) 导致过度自信的错误。这些问题在视觉-语言模型 (如 CLIP) 中表现为 2D 嵌入迁移 (图像-文本错位),而在医学模型 (如 SAM) 中则表现为 3D 域迁移 (如扫描仪差异) 及体素级校准需求。现有解决方案领域依赖,本文提出 StaRFM:融合 Fisher 信息惩罚 (FIP) 与置信度错位惩罚 (CMP) 的方案,以解决上述挑战。该方法通过 patch 级正则化将 FIP 扩展至 3D 以减少嵌入迁移,同时对体素级预测重新表述 CMP 以校准分割不确定性。我们推导 PAC-Bayes 边界,指出 FIP 通过 Fisher-Rao 范数控制泛化,CMP 通过最小化 Brier 分数降低校准误差。实验表明,StaRFM 在 19 个视觉数据集 (如 ImageNet、Office-Home) 上准确率提升 3.5%,等效 ECE 降低 28%;在 BraTS、ATLAS 等医学基准上,SAM-FT 的 DSC 提升 4.2%,HD95 降低 4.8mm,跨域差距降低最高 20%。该框架模块化,几乎无需架构修改。代码与模型已公开:https://anonymous.4open.science/r/StaRFM-C0CD/

关键词

引用

@article{arxiv.2507.09222,
  title  = {Calibrated and Robust Foundation Models for Vision-Language and Medical Image Tasks Under Distribution Shift},
  author = {Behraj Khan and Tahir Qasim Syed and Nouman M. Durrani and Bilal Naseem and Shabir Ahmad and Rizwan Qureshi},
  journal= {arXiv preprint arXiv:2507.09222},
  year   = {2025}
}