BiPrompt:用于视觉和文本去偏的双向提示优化
计算机视觉与模式识别
2026-01-06 v1 人工智能
机器学习
摘要
视觉语言基础模型如 CLIP 在零样本泛化方面表现出色,但仍然容易受到视觉和文本模态之间伪相关的影响。现有的去偏方法通常仅针对单一模态(视觉或文本)进行处理,导致部分鲁棒性和在分布迁移下的适应不稳定。我们提出了一种双向提示优化框架 (BiPrompt),在测试时同时缓解两种模态中非因果特征的依赖。在视觉模态方面,它采用结构化注意力引导的擦除,以抑制背景激活并强制因果区域与伪相关区域之间保持正交预测一致性。在文本模态方面,它引入了平衡提示归一化,这是一种可学习的重新中心化机制,将类别嵌入对齐到各向同性语义空间。这些模块共同最小化伪相关线索与预测之间的条件互信息,引导模型进行因果、领域不变的推理,而无需重新训练或领域监督。在真实世界和合成偏置基准上的广泛评估表明,与现有测试时去偏方法相比,BiPrompt 在平均和最差组准确率上均实现了一致的改进,为可靠且在因果层面上受支持的视觉语言适应树立了轻量且有效的路径。
引用
@article{arxiv.2601.02147,
title = {BiPrompt: Bilateral Prompt Optimization for Visual and Textual Debiasing in Vision-Language Models},
author = {Sunny Gupta and Shounak Das and Amit Sethi},
journal= {arXiv preprint arXiv:2601.02147},
year = {2026}
}
备注
Accepted at the AAAI 2026 Workshop AIR-FM, Assessing and Improving Reliability of Foundation Models in the Real World