基于分割的 ViT CLIP 测试时偏置消除(SegDebias)
计算机视觉与模式识别
2025-11-04 v1
摘要
视觉语言模型如 CLIP 在零样本分类中显示出卓越性能,但仍易受到不恰当相关性的影响,其中无关视觉特征会影响预测。现有消偏置方法通常需要访问训练数据并获取显式的组标签进行微调或调整嵌入,从而限制了其在实际场景中的实用性。测试时方法试图避免此限制,但许多方法仍依赖于数据集特定偏置的先验知识,限制了其在开放集设置中的通用性。在本工作中,我们提出了一种针对基于 ViT 的 CLIP 模型的测试时消偏置方法,无需额外训练或偏置注释假设。我们的 approach 使用预训练的分割模型隔离目标视觉属性,然后调整非目标区域,使其嵌入对所有类别特定文本提示均呈均匀相似性。这一程序从干扰视觉区域中移除意外偏置信号,同时保留目标属性。在 Waterbirds 和 CelebA 上的实验表明,我们的方法在组鲁棒性指标和注意力 IoU 方面均优于现有的测试时消偏置方法。这些结果表明分割引导的干预在视觉语言模型中实现可扩展且无注释消偏置方面有效。
引用
@article{arxiv.2511.00523,
title = {SegDebias: Test-Time Bias Mitigation for ViT-Based CLIP via Segmentation},
author = {Fangyu Wu and Yujun Cai},
journal= {arXiv preprint arXiv:2511.00523},
year = {2025}
}