医学视觉语言模型的全面 conformal 适配
计算机视觉与模式识别
2025-06-09 v1
摘要
大规模预训练的视觉语言模型(VLMs)展现了前所未有的迁移能力,正逐步被集成到医学图像分析中。尽管其判别潜力已被广泛探索,但其可靠性方面却被忽视了。本文研究了这些模型在日益流行的 split conformal prediction(SCP)框架下的行为,该框架通过利用标记的校准集,理论上保证给定误差水平的输出集。然而,VLMs 的零样本性能本质上受限,常见做法是采用few-shot迁移学习管线,而这无法吸收SCP的刚性可交换性假设。为缓解此问题,我们提出了全面 conformal 适配(full conformal adaptation),这是一种新的设置,用于联合适配和 conformal 化预训练基础模型,能够在每个测试数据点上进行 transductive 适配。此外,我们引入了 SS-Text,一种 novel 的训练-free 线性探针求解器,用于 VLMs,以降低此类 transductive 方法的计算成本。我们使用 3 种不同模态专用的医学 VLMs 和 9 个适配任务进行了全面实验。我们的框架所需的数据与 SCP 完全相同,能够在保持相同覆盖保证的同时,将集合效率提升最高可达 27%。
关键词
引用
@article{arxiv.2506.06076,
title = {Full Conformal Adaptation of Medical Vision-Language Models},
author = {Julio Silva-Rodríguez and Leo Fillioux and Paul-Henry Cournède and Maria Vakalopoulou and Stergios Christodoulidis and Ismail Ben Ayed and Jose Dolz},
journal= {arXiv preprint arXiv:2506.06076},
year = {2025}
}
备注
IPMI 2025. Code: https://github.com/jusiro/FCA