中文

基于 CLIP 的 Logits 去混淆:少样本学习

计算机视觉与模式识别 2025-04-17 v1

摘要

凭借强大的视觉-语言对齐能力,CLIP 在零样本和少样本学习任务中表现优异。然而,我们在实验中发现 CLIP 的 logits 在下游任务中存在严重的类别混淆问题,类别间的歧义严重影响准确率。为解决这一挑战,我们提出一种新方法,称为 Logits 去混淆(Logits DeConfusion),通过结合我们的多层适配器融合(MAF)模块和我们的类别去混淆(ICD)模块有效地消除 logits 中的类别间混淆。我们的 MAF 从不同层提取特征并统一融合,以增强特征表示。我们的 ICD 通过残差结构可学习地消除 logits 中的类别间混淆。实验结果表明,我们的方法能显著提高分类性能并缓解类别间混淆问题。代码已公开于 https://github.com/LiShuo1001/LDC。

关键词

引用

@article{arxiv.2504.12104,
  title  = {Logits DeConfusion with CLIP for Few-Shot Learning},
  author = {Shuo Li and Fang Liu and Zehua Hao and Xinyi Wang and Lingling Li and Xu Liu and Puhua Chen and Wenping Ma},
  journal= {arXiv preprint arXiv:2504.12104},
  year   = {2025}
}

备注

CVPR 2025