解耦 CLIP 中的模板偏差:利用空提示增强少样本学习
计算机视觉与模式识别
2025-12-11 v2 人工智能
摘要
对比语言-图像预训练(CLIP)模型通过对齐视觉和文本表示,在少样本学习中表现出色。本研究表明,模板-样本相似度(TSS),即文本模板与图像样本之间的相似性,会引入偏差。这种偏差导致模型依赖模板接近性而非真实的样本到类别对齐,从而降低了分类的准确性和鲁棒性。我们提出了一种框架,使用空提示——即传达"空"概念而不含类别信息的文本输入。这些提示捕获无偏的模板特征并抵消 TSS 偏差。该框架采用两个阶段。在预训练阶段,空提示揭示并减少 CLIP 编码器中的模板诱导偏差。在少样本微调阶段,偏差校准损失强制图像与其类别之间的正确对齐,确保模型关注相关视觉线索。多个基准上的实验表明,我们的模板校正方法显著减少了由 TSS 引起的性能波动,从而获得更高的分类准确性和更强的鲁棒性。该项目的代码库位于 https://github.com/zhenyuZ-HUST/Decoupling-Template-Bias-in-CLIP。
引用
@article{arxiv.2512.08606,
title = {Decoupling Template Bias in CLIP: Harnessing Empty Prompts for Enhanced Few-Shot Learning},
author = {Zhenyu Zhang and Guangyao Chen and Yixiong Zou and Zhimeng Huang and Yuhua Li},
journal= {arXiv preprint arXiv:2512.08606},
year = {2025}
}
备注
14 pages, 8 figures, Association for the Advancement of Artificial Intelligence (AAAI2026, poster)