基于语义保持对抗嵌入网络的零样本视觉识别
计算机视觉与模式识别
2018-04-03 v2
摘要
我们提出一种称为语义保持对抗嵌入网络(SP-AEN)的新颖框架,用于零样本视觉识别(ZSL),其中测试图像及其类别在训练时均不可见。SP-AEN 旨在解决主流基于嵌入的 ZSL 方法中固有的问题——语义丢失:若某些语义对训练类别无判别性,则在训练过程中会被丢弃,但这些语义可能对识别测试类别至关重要。具体而言,SP-AEN 通过引入独立的视觉到语义空间嵌入器来防止语义丢失,该嵌入器将语义空间解耦为两个子空间以服务于两个可谓冲突的目标:分类与重构。通过对两个子空间进行对抗学习,SP-AEN 可将语义从重构子空间迁移至判别子空间,从而实现对未见类别的改进零样本识别。与先前工作相比,SP-AEN 不仅能改进分类,还可生成照片级真实感图像,证明了语义保持的有效性。在 CUB、AWA、SUN 和 aPY 四个流行基准上,SP-AEN 在调和均值方面分别以 12.2%、9.3%、4.0% 和 3.6% 的绝对性能差异大幅优于其他最优方法。
引用
@article{arxiv.1712.01928,
title = {Zero-Shot Visual Recognition using Semantics-Preserving Adversarial Embedding Networks},
author = {Long Chen and Hanwang Zhang and Jun Xiao and Wei Liu and Shih-Fu Chang},
journal= {arXiv preprint arXiv:1712.01928},
year = {2018}
}