中文

用于动作检测的异步交互聚合

计算机视觉与模式识别 2020-04-17 v1

摘要

理解交互是视频动作检测的重要组成部分。我们提出异步交互聚合网络(AIA),利用不同交互来提升动作检测。其中有两个关键设计:一是交互聚合结构(IA),采用统一范式对多种类型交互进行建模与整合;二是异步记忆更新算法(AMU),通过对极长时交互进行动态建模而无需巨大计算成本,从而获得更优性能。我们提供经验证据表明,我们的网络可从整合交互中获得显著精度提升,且易于端到端训练。我们的方法在 AVA 数据集上报告了新的最先进性能,相比强基线在验证集上获得 3.7 mAP 提升(相对改进 12.6%)。在 UCF101-24 和 EPIC-Kitchens 数据集上的结果进一步说明了我们方法的有效性。源代码将公开于:https://github.com/MVIG-SJTU/AlphAction 。

关键词

引用

@article{arxiv.2004.07485,
  title  = {Asynchronous Interaction Aggregation for Action Detection},
  author = {Jiajun Tang and Jin Xia and Xinzhi Mu and Bo Pang and Cewu Lu},
  journal= {arXiv preprint arXiv:2004.07485},
  year   = {2020}
}