中文

RaVL:发现并缓解微调视觉-语言模型中的虚假相关性

计算机视觉与模式识别 2024-11-07 v1 人工智能

摘要

微调的视觉-语言模型(VLMs)经常捕获图像特征与文本属性之间的虚假相关性,导致测试时的零样本性能下降。现有处理虚假相关性的方法(i)主要在全局图像层面运作,而非直接干预细粒度图像特征;(ii)主要设计用于单模态设置。在本工作中,我们提出了RaVL,通过利用局部图像特征而非全局图像层面来发现并缓解虚假相关性,从而采取细粒度视角审视VLM鲁棒性。给定一个微调后的VLM,RaVL首先通过利用区域级聚类方法发现虚假相关性,以识别导致零样本分类错误的精确图像特征。然后,RaVL通过一种新颖的区域感知损失函数来缓解已识别的虚假相关性,使VLM在微调过程中关注相关区域并忽略虚假关系。我们在654个具有各种模型架构、数据域和已学习虚假相关性的VLMs上评估了RaVL。结果表明,RaVL能够准确发现(相比最接近的基线提升191%)并缓解(最差组图像分类准确率提升8.2%)虚假相关性。在通用域和医学域VLMs上的定性评估证实了我们的发现。

关键词

引用

@article{arxiv.2411.04097,
  title  = {RaVL: Discovering and Mitigating Spurious Correlations in Fine-Tuned Vision-Language Models},
  author = {Maya Varma and Jean-Benoit Delbrouck and Zhihong Chen and Akshay Chaudhari and Curtis Langlotz},
  journal= {arXiv preprint arXiv:2411.04097},
  year   = {2024}
}

备注

NeurIPS 2024