中文

群体中的黑羊:为视觉语言识别玩转误关联属性

机器学习 2025-02-25 v1 图像与视频处理

摘要

视觉语言模型(VLMs)的零样本适应面临一种困境:在分布内准确性与分布外泛化之间进行权衡。近期研究利用低级概念如视觉属性来增强泛化性,但本研究发现 VLMs 过度依赖决策中少数属性,这些属性与类别共现但本身并非该类别的一部分,称为误关联属性。这种 VLMs 的偏性导致泛化性差。为解决此问题,我们首先提出了误关联属性探测(SAP),识别并过滤这些有问题的属性以显著增强现有基于属性的方法的泛化性;其次,我们引入了误关联属性防护(SAS),是一个即插即用的模块,可消除这些属性对预测的影响,无缝集成到各种参数高效微调 (PEFT) 方法中。在实验中,SAP 和 SAS 在 11 个数据集和 3 个泛化任务上显著提升了分布迁移后的准确率,且未损害下游性能,建立了新的最先进基准。

关键词

引用

@article{arxiv.2502.15809,
  title  = {Black Sheep in the Herd: Playing with Spuriously Correlated Attributes for Vision-Language Recognition},
  author = {Xinyu Tian and Shu Zou and Zhaoyuan Yang and Mengqi He and Jing Zhang},
  journal= {arXiv preprint arXiv:2502.15809},
  year   = {2025}
}

备注

Accepted to ICLR2025