CAPT:基于混淆感知的提示调谐以减少视觉语言误对齐
计算机视觉与模式识别
2026-03-04 v1 人工智能
摘要
视觉语言模型如CLIP在跨模态表征学习方面取得了显著进展,但因在视觉和语义上相似类别之间出现系统性误分类而受到制约。我们观察到,这类混淆模式并非随机发生,而是持续出现在特定类别对之间,揭示了模型的内在偏见及其有限的细粒度辨识能力。为此,我们提出了CAPT(Confusion-Aware Prompt Tuning),一个使模型从自身误对齐中学习的框架。具体而言,我们构建了混淆银行(Confusion Bank),显式建模跨类别和未分类样本中持久的混淆关系。基于此,我们引入语义混淆矿工(SEM)通过语义差异和共性提示捕获全局类别间的混淆,以及样本混淆矿工(SAM)从银行中检索代表性未分类实例并通过Diff-Manner适配器整合全局和局部语境捕获样本级线索。为进一步统一不同粒度的混淆信息,我们设计了多粒度差异专家(MGDE)模块,以协同利用语义和样本级专家,实现更稳健的混淆感知推理。在11个基准数据集上的大量实验表明,我们的方法显著减少了由混淆导致的错误,增强了基本类和新类的辨识度和泛化能力,成功解决了50.72%的可混淆样本对。代码将在 https://github.com/greatest-gourmet/CAPT 发布。
引用
@article{arxiv.2603.02557,
title = {CAPT: Confusion-Aware Prompt Tuning for Reducing Vision-Language Misalignment},
author = {Maoyuan Shao and Yutong Gao and Xinyang Huang and Chuang Zhu and Lijuan Sun and Guoshun Nan},
journal= {arXiv preprint arXiv:2603.02557},
year = {2026}
}
备注
Accepted by CVPR2026