中文

面向细粒度零样本学习的堆叠语义引导注意力模型

计算机视觉与模式识别 2018-05-22 v1

摘要

零样本学习(ZSL)通过对齐全局图像特征向量与相应类别语义描述之间的语义关系来实现。然而,使用全局特征表示细粒度图像可能导致次优结果,因为它们忽略了局部区域的判别性差异。此外,不同区域包含不同的判别信息,重要区域应对预测贡献更多。为此,我们提出一种新颖的堆叠语义引导注意力(S2GA)模型,利用各类别语义特征逐步引导视觉特征生成注意力图,以加权不同局部区域的重要性,从而获得语义相关特征。将整合后的视觉特征与类别语义特征一同输入多类分类架构,所提框架可端到端训练。在 CUB 和 NABird 数据集上的大量实验结果表明,该方法在细粒度零样本分类与检索任务上均取得了一致性提升。

关键词

引用

@article{arxiv.1805.08113,
  title  = {Stacked Semantic-Guided Attention Model for Fine-Grained Zero-Shot Learning},
  author = {Yunlong Yu and Zhong Ji and Yanwei Fu and Jichang Guo and Yanwei Pang and Zhongfei Zhang},
  journal= {arXiv preprint arXiv:1805.08113},
  year   = {2018}
}