中文

校准多模态表示:在无标注条件下追求群体鲁棒性

计算机视觉与模式识别 2024-11-05 v2 机器学习

摘要

微调预训练视觉 - 语言模型(如 CLIP)已在多种下游任务中取得成功。然而,该范式仍存在几个痛点:(i) 直接微调整个预训练模型既耗时又计算成本高昂;此外,这些经过微调的模型往往变得高度专用化,限制了其在现实世界部署中的实用性;(ii) 最近的研究表明,预训练的视觉 - 语言分类器可能过度依赖虚假特征——即与训练数据中的目标相关但与真实标记函数无关的模式;(iii) 现有关于减轻对虚假特征依赖的研究主要基于我们可以识别此类特征的假设,未能为现实世界应用提供确凿保证。作为一项试点研究,本工作专注于在不使用任何群体标注的情况下,探索减轻 CLIP 对虚假特征的依赖。为此,我们系统研究了 CLIP 和 CLIP+ERM 中虚假相关性的存在。首先,遵循近期关于深度特征重加权 (DFR) 的工作,我们验证了最后一层重训练可以显著提高预训练 CLIP 的群体鲁棒性。鉴于此,我们提倡一种用于微调 CLIP 的轻量级表示校准方法:首先利用预训练 CLIP 生成校准集,然后通过对比学习校准该集中样本的表示,全程无需群体标签。在多个基准测试上进行的大量实验和深入可视化验证了我们提案的有效性,大幅减少了对虚假特征的依赖并显著提升了模型泛化能力。

关键词

引用

@article{arxiv.2403.07241,
  title  = {Calibrating Multi-modal Representations: A Pursuit of Group Robustness without Annotations},
  author = {Chenyu You and Yifei Min and Weicheng Dai and Jasjeet S. Sekhon and Lawrence Staib and James S. Duncan},
  journal= {arXiv preprint arXiv:2403.07241},
  year   = {2024}
}

备注

Accepted by CVPR 2024