中文

用于动作识别的高阶网络

计算机视觉与模式识别 2019-11-20 v4

摘要

捕捉时空动态是视频识别中的一个重要课题。在本文中,我们提出可学习的高阶运算作为从 RGB 输入视频空间捕捉时空动态的一类通用构建模块。类似于高阶函数,高阶运算的权重本身是由带可学习参数的数据导出的。诸如残差学习和网络中的网络等经典架构是一阶运算,其权重直接从数据学习。高阶运算使得捕捉对上下文敏感的模式(如运动)更为容易。自注意力模型也是高阶运算,但注意力权重大多由仿射运算或点积计算。可学习的高阶运算可以更通用和灵活。在实验上,我们表明在视频识别任务上,我们的高阶模型在 Something-Something(V1 和 V2)、Kinetics 和 Charades 数据集上可取得与现有最先进方法相当或更好的结果。

关键词

引用

@article{arxiv.1811.07519,
  title  = {Higher-order Network for Action Recognition},
  author = {Kai Hu and Bhiksha Raj},
  journal= {arXiv preprint arXiv:1811.07519},
  year   = {2019}
}