Spurious Feature Eraser:稳定视觉 - 语言基础模型的测试时适应
计算机视觉与模式识别
2025-01-15 v3 人工智能
机器学习
摘要
视觉 - 语言基础模型因其在大量图像 - 文本配对数据上的可扩展性,而在众多下游任务中表现出显著的成功。然而,由于阻碍其泛化能力的“决策捷径”,这些模型在应用于细粒度图像分类等下游任务时也显示出明显的局限性。在这项工作中,我们发现 CLIP 模型拥有丰富的特征集,涵盖\textit{期望的不变因果特征}和\textit{不期望的决策捷径}。此外,CLIP 在下游任务上的表现不佳源于其无法根据特定任务要求有效利用预训练特征。为了应对这一挑战,我们提出了一种简单而有效的方法,即 Spurious Feature Eraser (SEraser),通过擦除虚假特征来缓解决策捷径。具体而言,我们引入了一种测试时提示调优范式,优化可学习的提示,从而迫使模型在推理阶段利用不变特征而忽略决策捷径。所提出的方法有效地减轻了对潜在误导性虚假信息的过度依赖。我们将所提方法与各种方法进行了对比分析,验证了其显著的优势。
引用
@article{arxiv.2403.00376,
title = {Spurious Feature Eraser: Stabilizing Test-Time Adaptation for Vision-Language Foundation Model},
author = {Huan Ma and Yan Zhu and Changqing Zhang and Peilin Zhao and Baoyuan Wu and Long-Kai Huang and Qinghua Hu and Bingzhe Wu},
journal= {arXiv preprint arXiv:2403.00376},
year = {2025}
}