利用概念对齐与混淆感知校准间隔处理视觉-语言模型中的不平衡伪标签
计算机视觉与模式识别
2025-05-06 v1 机器学习
摘要
使用伪标签将视觉-语言模型(VLM)适应下游任务已获得越来越多的关注。一个主要障碍是 VLM 生成的伪标签往往不平衡,导致性能不佳。虽然现有方法探索了各种策略来解决此问题,但导致不平衡的根本原因仍未得到充分研究。为填补这一空白,我们深入研究了不平衡伪标签,并确定了两个主要促成因素:概念不匹配和概念混淆。为缓解这两个问题,我们提出一个新颖的框架,该框架结合了概念对齐和混淆感知校准间隔机制。我们方法的核心在于增强表现不佳的类别并促进跨类别的平衡预测,从而缓解不平衡。在六个基准数据集上使用三种学习范式进行的大量实验表明,所提出的方法有效提高了伪标签的准确性和平衡性,相对 SoTA 方法实现了 6.29% 的提升。我们的代码可在 https://anonymous.4open.science/r/CAP-C642/ 获取。
引用
@article{arxiv.2505.02056,
title = {Handling Imbalanced Pseudolabels for Vision-Language Models with Concept Alignment and Confusion-Aware Calibrated Margin},
author = {Yuchen Wang and Xuefeng Bai and Xiucheng Li and Weili Guan and Liqiang Nie and Xinyang Chen},
journal= {arXiv preprint arXiv:2505.02056},
year = {2025}
}
备注
Accepted to ICML 2025