UMFC:面向视觉语言模型的无监督多域特征校准
计算机视觉与模式识别
2024-11-12 v1
摘要
预训练的视觉语言模型(如 CLIP)已展现出强大的零样本迁移能力。但它们仍然难以应对域偏移,通常需要标注数据来适应下游任务,这可能成本高昂。在这项工作中,我们旨在利用自然跨越多个域的未标注数据来增强视觉语言模型的迁移性。在这一无监督多域设定下,我们识别了 CLIP 中固有的模型偏差,特别是在其视觉编码器和文本编码器中。具体而言,我们观察到 CLIP 的视觉编码器倾向于优先编码域信息而非判别性类别信息,同时其文本编码器表现出对域相关类别的偏好。为缓解这种模型偏差,我们提出了一种无需训练和标注的特征校准方法——无监督多域特征校准(UMFC)。UMFC 从域特定特征估计图像级偏差,从域转换方向估计文本级偏差。随后将这些偏差分别从原始图像特征和文本特征中减去,使其具有域不变性。我们在多个设定下评估了所提方法,包括转导学习和测试时适应。大量实验表明,我们的方法优于 CLIP,且性能与需要额外标注或优化的最先进方法相当。我们的代码可在 https://github.com/GIT-LJc/UMFC 获取。
引用
@article{arxiv.2411.06921,
title = {UMFC: Unsupervised Multi-Domain Feature Calibration for Vision-Language Models},
author = {Jiachen Liang and Ruibing Hou and Minyang Hu and Hong Chang and Shiguang Shan and Xilin Chen},
journal= {arXiv preprint arXiv:2411.06921},
year = {2024}
}
备注
NeurIPS 2024