中文

面向广义零样本分类的学习对齐跨模态表示

计算机视觉与模式识别 2021-12-28 v1

摘要

通过对齐跨模态自编码器的潜空间来学习公共潜在嵌入,是广义零样本分类(GZSC)的一种有效策略。然而,由于缺乏细粒度实例级标注,由于多样化图像的视觉表示与固定属性的语义表示之间存在差异,它仍容易遭受域偏移问题。本文中,我们提出一种创新的自动编码器网络,通过学习对齐跨模态表示(称为 ACMR)用于 GZSC。具体而言,我们提出一种新颖的视觉-语义对齐(VSA)方法,在由所学分类器引导的潜在子空间上加强跨模态潜在特征的对齐。此外,我们提出一种新颖的信息增强模块(IEM),以降低潜在变量坍缩的可能性,同时提升潜在变量的判别能力。在公开数据集上的大量实验证明了我们方法的最先进性能。

关键词

引用

@article{arxiv.2112.12927,
  title  = {Learning Aligned Cross-Modal Representation for Generalized Zero-Shot Classification},
  author = {Zhiyu Fang and Xiaobin Zhu and Chun Yang and Zheng Han and Jingyan Qin and Xu-Cheng Yin},
  journal= {arXiv preprint arXiv:2112.12927},
  year   = {2021}
}