中文

解耦语义到视觉混淆的零样本学习

计算机视觉与模式识别 2021-06-17 v1

摘要

利用生成模型从语义分布合成视觉特征是近年来 ZSL 图像分类最流行的解决方案之一。三元组损失(TL)被广泛用于通过自动搜索判别性表示来从语义生成真实的视觉分布。然而,由于 ZSL 中不可见类的不可用性,传统 TL 无法搜索可靠的不可见解耦表示。为缓解这一缺陷,我们在本工作中提出一种多模态三元组损失(MMTL),其利用多模态信息来搜索解耦表示空间。这样一来,所有类都可以相互作用,从而有利于在所搜索空间中学习解耦的类表示。此外,我们开发了一种称为解耦类表示生成对抗网络(DCR-GAN)的新模型,专注于在训练、特征合成和最终识别阶段利用解耦表示。受益于解耦表示,DCR-GAN 可以在可见和不可见特征上拟合更真实的分布。大量实验表明,我们提出的模型在四个基准数据集上优于最先进方法。我们的代码可在 https://github.com/FouriYe/DCRGAN-TMM 获取。

关键词

引用

@article{arxiv.2106.08605,
  title  = {Disentangling Semantic-to-visual Confusion for Zero-shot Learning},
  author = {Zihan Ye and Fuyuan Hu and Fan Lyu and Linyan Li and Kaizhu Huang},
  journal= {arXiv preprint arXiv:2106.08605},
  year   = {2021}
}

备注

Accepted by IEEE TRANSACTIONS ON MULTIMEDIA (TMM) in 2021