中文

A3D:用于视频动作识别的自适应 3D 网络

计算机视觉与模式识别 2020-11-26 v1 人工智能

摘要

本文提出 A3D,一种自适应 3D 网络,可通过一次训练在宽泛的计算约束下完成推理。它并非以网格搜索方式训练多个模型,而是通过权衡网络宽度与时空分辨率来生成良好配置。此外,模型部署后其计算成本可自适应调整以满足可变约束,例如在边缘设备上。即便在相同计算约束下,通过沿三个维度的相互训练,我们自适应网络的性能也能较基线对应网络显著提升。当采用如 SlowFast 的多通路框架时,我们的自适应方法比人工设计鼓励了通路间更好的权衡。在 Kinetics 数据集上的大量实验表明了所提框架的有效性。性能增益也被验证可在数据集与任务间良好迁移。代码将公开。

关键词

引用

@article{arxiv.2011.12384,
  title  = {A3D: Adaptive 3D Networks for Video Action Recognition},
  author = {Sijie Zhu and Taojiannan Yang and Matias Mendieta and Chen Chen},
  journal= {arXiv preprint arXiv:2011.12384},
  year   = {2020}
}