中文

CRoF:基于 CLIP 的带噪标签鲁棒少样本学习

计算机视觉与模式识别 2024-12-18 v1

摘要

由于新域中特征的不精确性,噪声标签威胁着少样本学习(FSL)的鲁棒性。CLIP 作为一个大规模视觉-语言模型,在基于图像-文本嵌入相似度的 FSL 中表现良好,但它容易受到噪声标签引起的误分类的影响。如何在 FSL 任务中增强 CLIP 在噪声数据上的域泛化能力是一个关键挑战。在本文中,我们提供了一种缓解噪声标签影响的新视角,即基于 CLIP 的鲁棒少样本学习。CRoF 是一个通用的即插即用模块,适用于基于 CLIP 的模型。为了避免误分类和混淆的标签嵌入,我们设计了面向少样本任务的提示生成器,为每个类别提供更具判别性的描述。所提出的提示实现了更大的类间文本嵌入距离。此外,我们没有完全信任 CLIP 的零样本分类,而是采用类似标签平滑的加权策略,在新域的噪声少样本数据上微调 CLIP。多个潜在正确标签的权重考虑了 CLIP 的先验知识与原始标签信息之间的关系,以确保可靠性。我们的多标签损失函数进一步支持了这种范式下的鲁棒训练。综合实验表明,CRoF 作为即插即用模块,在不同噪声类型和噪声比例下均优于微调后的和原始的 CLIP 模型。

关键词

引用

@article{arxiv.2412.12793,
  title  = {CRoF: CLIP-based Robust Few-shot Learning on Noisy Labels},
  author = {Shizhuo Deng and Bowen Han and Jiaqi Chen and Hao Wang and Dongyue Chen and Tong Jia},
  journal= {arXiv preprint arXiv:2412.12793},
  year   = {2024}
}