中文

视觉用GAN、关系用KG:一种用于零样本动作识别的两阶段深度网络

计算机视觉与模式识别 2021-05-26 v1

摘要

零样本动作识别可通过挖掘样本间共同的潜在语义表示,识别训练时不可见的类别样本。然而,多数方法忽视了动作类别间的内涵关系与外延关系,导致零样本学习的泛化能力较差。此外,所学分类器倾向于预测可见类别的样本,导致分类性能不佳。为解决上述问题,我们提出一种用于零样本动作识别的两阶段深度神经网络,其由作为采样阶段的特征生成子网络和作为分类阶段的图注意力子网络组成。在采样阶段,我们利用由可见类别的动作特征与词向量训练的生成对抗网络(GAN)来合成不可见类别的动作特征,从而平衡可见类别与不可见类别的训练样本数据。在分类阶段,我们基于动作类别词向量与相关对象之间的关系构建知识图谱(KG),并提出基于注意力机制的图卷积网络(GCN),其动态更新动作类别与对象间的关系,增强零样本学习的泛化能力。两个阶段均使用词向量作为从可见类别到不可见类别的特征生成与分类器泛化的桥梁。我们在UCF101与HMDB51数据集上将所提方法与最先进(SOTA)方法进行比较。实验结果表明,我们所提方法提升了训练后分类器的分类性能并取得了更高准确率。

关键词

引用

@article{arxiv.2105.11789,
  title  = {GAN for Vision, KG for Relation: a Two-stage Deep Network for Zero-shot Action Recognition},
  author = {Bin Sun and Dehui Kong and Shaofan Wang and Jinghua Li and Baocai Yin and Xiaonan Luo},
  journal= {arXiv preprint arXiv:2105.11789},
  year   = {2021}
}

备注

19 pages, 7 figures