中文

用于视频动作识别的知识融合 Transformer

计算机视觉与模式识别 2020-10-01 v2

摘要

我们引入用于视频动作分类的知识融合 Transformer(Knowledge Fusion Transformers)。我们提出一种基于自注意力的特征增强器,以在待分类视频片段的基于 3D inception 的时空上下文中融合动作知识。我们展示了仅使用单流网络且极少或无需预训练如何能为接近当前最优(state-of-the-art)的性能铺平道路。此外,我们展示了在网络不同层级使用的不同自注意力架构如何被融入以增强特征表示。我们的架构在 UCF-101 与 Charades 数据集上训练与评估,其与最优方法具有竞争力。相比极少或无需预训练的单流网络,它亦以大幅差距超越之。

关键词

引用

@article{arxiv.2009.13782,
  title  = {Knowledge Fusion Transformers for Video Action Recognition},
  author = {Ganesh Samarth and Sheetal Ojha and Nikhil Pareek},
  journal= {arXiv preprint arXiv:2009.13782},
  year   = {2020}
}

备注

7 pages