中文

基于 CLIP 的带模糊标签的零样本学习

计算机视觉与模式识别 2026-03-06 v1

摘要

零样本学习(ZSL)旨在通过利用已见类别的语义信息来识别未见的类别,但大多数现有方法都假设训练实例具有准确的类别标签。然而,在实际场景中,噪声和模糊标签会显著降低 ZSL 的性能。为此,我们提出了一种新的 CLIP 驱动的部分标签零样本学习(CLIP-PZSL)框架,用于处理标签模糊性。首先,我们使用 CLIP 提取实例和标签特征。随后,一个语义挖掘模块融合这些特征,以提取判别性标签嵌入。我们还引入了部分零样本损失,根据其与实例相关性为候选标签分配权重,并对实例和标签嵌入进行对齐以最小化语义不匹配。随着训练的进行,真实标签逐渐被识别,精炼后的标签和标签嵌入反过来又有助于提高实例和标签特征的语义对齐。多个数据集上的全面实验表明,CLIP-PZSL 的优势显而易见。

关键词

引用

@article{arxiv.2603.05053,
  title  = {CLIP-driven Zero-shot Learning with Ambiguous Labels},
  author = {Jinfu Fan and Jiangnan Li and Xiaowen Yan and Xiaohui Zhong and Wenpeng Lu and Linqing Huang},
  journal= {arXiv preprint arXiv:2603.05053},
  year   = {2026}
}

备注

Accepted by ICASSP 2026 (IEEE International Conference on Acoustics, Speech, and Signal Processing)