中文

面向零样本学习的判别式图像生成

计算机视觉与模式识别 2024-12-30 v2

摘要

生成式零样本学习 (ZSL) 方法基于预定义的类语原型合成与类相关特征,展现出卓越的性能。然而,这一特征生成范式未能提供可解释的洞见。此外,现有方法依赖由人类专家标注的语义原型,在扩展至通用场景时存在显著可扩展性限制。为克服这些缺陷,一个自然的解决方案是使用文本提示为未见类生成图像。为此,我们提出了 DIG-ZSL,即面向零样本学习的判别式图像生成框架。具体而言,为确保为训练有效 ZSL 分类器生成判别图像,我们在预训练的类别判别模型 (CDM) 的指导下学习每个未见类的判别类标记 (DCT)。借助 DCT,我们可以生成多样且高质量的图像,这些图像作为 ZSL 任务的Informative 未见样本。本文通过在四个数据集上的大量实验和可视化结果表明,我们的 DIG-ZSL: (1) 生成多样且高质量的图像,(2) 以显著优势超越了大量基于非人类标注语义原型的前沿方法,(3) 实现了与基于人类标注语义原型的基线相当或更好的性能。代码将在论文接受后公开。

关键词

引用

@article{arxiv.2412.17219,
  title  = {Discriminative Image Generation with Diffusion Models for Zero-Shot Learning},
  author = {Dingjie Fu and Wenjin Hou and Shiming Chen and Shuhuang Chen and Xinge You and Salman Khan and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2412.17219},
  year   = {2024}
}

备注

Tech report, 16 pages