零样本模型的共形预测
计算机视觉与模式识别
2025-06-02 v1
摘要
大规模预训练的视觉-语言模型展现了对下游任务前所未有的适应性和泛化能力。尽管其判别潜力已被广泛探索,但其可靠性和不确定性仍被忽视。在这项工作中,我们在分裂共形预测范式下研究了 CLIP 模型的能力,该范式基于少量标注校准集为黑盒模型提供理论保证。与视觉分类器中关于共形预测器的主要文献体系相反,基础模型表现出一个特定特征:它们在不可访问的源域上进行一次性预训练,这与迁移目标任务不同。这种域漂移对共形集的效率产生负面影响,并带来了额外挑战。为缓解此问题,我们提出了 Conf-OT,这是一种在校准集和查询集的组合上进行直推式操作的迁移学习设置。通过求解最优传输问题,所提出的方法弥合了预训练和适应之间的域差距,无需额外的数据划分,同时仍保持覆盖保证。我们在涵盖 15 个数据集和三种非一致性分数的广泛范围内全面探索了这种共形预测策略。Conf-OT 在集合效率上提供了高达 20% 的一致相对改进,同时比流行的直推式方法快 15 倍。
引用
@article{arxiv.2505.24693,
title = {Conformal Prediction for Zero-Shot Models},
author = {Julio Silva-Rodríguez and Ismail Ben Ayed and Jose Dolz},
journal= {arXiv preprint arXiv:2505.24693},
year = {2025}
}
备注
CVPR 2025. Code: https://github.com/jusiro/CLIP-Conformal