中文

ZeroDiff: 在零样本学习中固化视觉-语义关联

计算机视觉与模式识别 2025-02-12 v2 机器学习

摘要

零样本学习(ZSL)旨在使分类器能够识别未见的类别。这通常通过从已见类别中学习的视觉-语义关联基础上,为未见类别生成视觉特征来实现。然而,大多数当前的生成方法高度依赖于已见类别的充足样本。我们的研究揭示,已见类别样本的稀缺性会导致许多生成式 ZSL 技术性能显著下降。我们认为,这一下降主要归因于虚假的视觉-语义关联。为解决这一问题,我们引入了 ZeroDiff,这是一个创新的 ZSL 生成框架,融合了扩散机制和对比表示,以增强视觉-语义关联。ZeroDiff 包含三个关键组件:(1)扩散数据增强,通过自然地将有限数据转化为一组噪声数据,以缓解生成模型的过拟合;(2)基于监督对比(SC)的表示,动态地描述每个有限样本,以支持视觉特征的生成;(3)多个特征判别器,采用基于 Wasserstein 距离的相互学习方法,从多个角度评估生成的特征,包括预定义语义、SC 表示和扩散过程。广泛的在三个流行 ZSL 数据集上的实验表明,ZeroDiff 不仅在现有 ZSL 方法上实现了显著的改进,还即使在样本稀缺的情况下仍能保持稳健的性能。我们的代码可在 https://github.com/FouriYe/ZeroDiff_ICLR25 获取。

关键词

引用

@article{arxiv.2406.02929,
  title  = {ZeroDiff: Solidified Visual-Semantic Correlation in Zero-Shot Learning},
  author = {Zihan Ye and Shreyank N. Gowda and Xiaowei Huang and Haotian Xu and Yaochu Jin and Kaizhu Huang and Xiaobo Jin},
  journal= {arXiv preprint arXiv:2406.02929},
  year   = {2025}
}

备注

Accepted to ICLR 2025