SAGE:基于虚假性感知的引导式提示探索以缓解多模态偏差
计算机视觉与模式识别
2025-11-18 v1 人工智能
摘要
大型视觉语言模型(如 CLIP)通过在共享嵌入空间中对齐图像和文本,展现出强大的零样本分类性能。然而,CLIP 模型常常发展出多模态虚假偏差(multimodal spurious bias),即模型倾向于依赖虚假特征。例如,CLIP 可能基于频繁共现的背景来推断图像中的物体类型,而非物体的核心特征。这种偏差显著损害了预训练 CLIP 模型在离分布数据上的鲁棒性,而在此类跨模态关联不再成立时尤为如此。现有的缓解多模态虚假偏差的方法通常需要在下游数据上进行微调,或依赖虚假偏差的先验知识,这些做法削弱了 CLIP 的开箱即用性。本文首先理论分析了在零样本分类中多模态虚假偏差的影响。基于此洞察,我们提出了一种简单有效的方法——虚假性感知引导探索(SAGE),通过引导式提示选择来缓解虚假偏差。SAGE 无需训练、微调或外部标注,能够探索提示模板空间,选取能在类别之间实现最大语义分离的提示,从而提升最坏情况下的鲁棒性。在四个真实世界基准数据集和五个流行主干模型上的大量实验表明,SAGE 在零样本性能和泛化能力方面 consistently 优于先前的零样本方法,且无需任何外部知识或模型更新。
引用
@article{arxiv.2511.13005,
title = {SAGE: Spuriousness-Aware Guided Prompt Exploration for Mitigating Multimodal Bias},
author = {Wenqian Ye and Di Wang and Guangtao Zheng and Bohan Liu and Aidong Zhang},
journal= {arXiv preprint arXiv:2511.13005},
year = {2025}
}
备注
Accepted at AAAI 2026