中文

具有视觉结构约束的直推式零样本学习

计算机视觉与模式识别 2020-01-07 v2

摘要

为识别未见类的对象,大多数现有零样本学习(ZSL)方法首先基于源可见类的数据学习公共语义空间与视觉空间之间的兼容投影函数,然后直接将其应用于目标未见类。然而,在真实场景中,源域与目标域之间的数据分布可能不匹配良好,从而引发众所周知的\textbf{域偏移}问题。基于测试实例的视觉特征可被分离为不同簇的观察,我们提出了一种新的用于直推式 ZSL 的类中心视觉结构约束,以改善投影函数的泛化性(即缓解上述域偏移问题)。具体而言,采用三种不同策略(对称倒角距离、二部匹配距离和 Wasserstein 距离)来对齐投影后的未见语义中心与测试实例的视觉簇中心。我们还提出了一种新的训练策略来处理测试数据集中存在许多不相关图像的真实情况,这是先前方法未考虑的。在多个广泛使用的数据集上的实验表明,所提出的视觉结构约束能持续带来显著的性能提升,并达到最先进结果。源代码可在 \url{https://github.com/raywzy/VSC} 获取。

关键词

引用

@article{arxiv.1901.01570,
  title  = {Transductive Zero-Shot Learning with Visual Structure Constraint},
  author = {Ziyu Wan and Dongdong Chen and Yan Li and Xingguang Yan and Junge Zhang and Yizhou Yu and Jing Liao},
  journal= {arXiv preprint arXiv:1901.01570},
  year   = {2020}
}

备注

NeurIPS 2019, code available at https://github.com/raywzy/VSC