中文

大规模视觉语言适配器的鲁棒校准

计算机视觉与模式识别 2024-07-19 v1

摘要

本文解决了CLIP模型适配中的关键校准问题,特别是在分布外(OOD)样本的挑战性场景下,这一问题在现有CLIP适配文献中常被忽视。我们实证表明,流行的CLIP适配方法(如适配器、提示学习和测试时适配)在分布漂移存在时,会显著降低零样本基线的校准能力。我们将logit范围增大识别为CLIP适配方法校准失效的根本原因,这与先前针对全监督模型校准的工作不同。基于这些见解,我们提出了一种简单且模型无关的解决方案:通过缩放每个样本的logit范围至其零样本预测logit来缓解校准问题。我们探索了三种实现方式,可在适配期间集成或直接在推理时使用。在流行的OOD分类基准上的综合实验表明,所提方法在保持判别性能的同时有效缓解了校准问题,且改进在这三类日益流行的方法中保持一致。代码公开于:https://github.com/Bala93/CLIPCalib。

关键词

引用

@article{arxiv.2407.13588,
  title  = {Robust Calibration of Large Vision-Language Adapters},
  author = {Balamurali Murugesan and Julio Silva-Rodriguez and Ismail Ben Ayed and Jose Dolz},
  journal= {arXiv preprint arXiv:2407.13588},
  year   = {2024}
}

备注

ECCV 2024