中文

面向域泛化的视觉-语言模型鲁棒微调

计算机视觉与模式识别 2023-11-07 v1 人工智能 计算与语言 机器学习

摘要

迁移学习使得模型间能够共享通用知识以服务于多种下游任务,但传统方法在训练数据有限的设定下表现不佳,并产生在分布偏移下无法有效泛化的狭隘模型。基础模型近来展现出令人印象深刻的零样本推理能力与在分布偏移下的鲁棒性。然而,这些模型的零样本评估主要局限于具有简单分布偏移的基准,限制了我们对其在实践里更真实偏移下有效性的理解。此外,这些模型的常见微调方法尚未在训练数据有限的少样本场景中与视觉模型进行过评估。为填补这些空白,我们提出了一种针对流行视觉-语言基础模型 CLIP 的少样本微调新方案,并在来自 WILDS 集合的具有真实分布偏移的挑战性基准数据集上评估其性能。我们的实验表明,尽管零样本 CLIP 在更复杂基准上未能匹配已训练视觉模型的性能,但少样本 CLIP 微调在所有训练数据可用级别上,就分布内与分布外准确率而言均优于其纯视觉对应模型。这为在利用真实世界数据的少样本学习应用中采用基础模型提供了强有力的动机。代码见 https://github.com/mit-ll/robust-vision-language-finetuning

关键词

引用

@article{arxiv.2311.02236,
  title  = {Robust Fine-Tuning of Vision-Language Models for Domain Generalization},
  author = {Kevin Vogt-Lowell and Noah Lee and Theodoros Tsiligkaridis and Marc Vaillant},
  journal= {arXiv preprint arXiv:2311.02236},
  year   = {2023}
}

备注

In proceedings of the 27th IEEE High Performance Extreme Computing Conference