中文

用于动作识别的知识整合网络

计算机视觉与模式识别 2020-02-19 v1

摘要

本文中,我们提出用于视频动作识别的知识整合网络(简称 KINet)。KINet 能够聚合对识别动作至关重要的有意义上下文特征,如人体信息与场景上下文。我们设计了一种三分支架构,包括用于动作识别的主分支,以及用于人体解析与场景识别的两个辅助分支,使模型能为动作识别编码人体与场景知识。我们探索了两个预训练模型作为教师网络,以蒸馏人体与场景知识来训练 KINet 的辅助任务。此外,我们提出了一种两级知识编码机制,包含用于将辅助知识编码至中层卷积特征的跨分支整合(CBI)模块,以及用于有效融合高层上下文信息的动作知识图(AKG)。这形成了一个端到端可训练框架,其中三个任务可协同训练,使模型能高效计算强上下文知识。所提 KINet 在大规模动作识别基准 Kinetics-400 上取得了最先进性能,top-1 准确率为 77.8%。我们进一步表明,通过将 Kinetics 训练的模型迁移至 UCF-101,我们的 KINet 具有强大能力,其获得了 97.8% 的 top-1 准确率。

关键词

引用

@article{arxiv.2002.07471,
  title  = {Knowledge Integration Networks for Action Recognition},
  author = {Shiwen Zhang and Sheng Guo and Limin Wang and Weilin Huang and Matthew R. Scott},
  journal= {arXiv preprint arXiv:2002.07471},
  year   = {2020}
}

备注

To appear in AAAI 2020