用于动作识别的高阶网络
计算机视觉与模式识别
2019-11-20 v4
摘要
捕捉时空动态是视频识别中的一个重要课题。在本文中,我们提出可学习的高阶运算作为从 RGB 输入视频空间捕捉时空动态的一类通用构建模块。类似于高阶函数,高阶运算的权重本身是由带可学习参数的数据导出的。诸如残差学习和网络中的网络等经典架构是一阶运算,其权重直接从数据学习。高阶运算使得捕捉对上下文敏感的模式(如运动)更为容易。自注意力模型也是高阶运算,但注意力权重大多由仿射运算或点积计算。可学习的高阶运算可以更通用和灵活。在实验上,我们表明在视频识别任务上,我们的高阶模型在 Something-Something(V1 和 V2)、Kinetics 和 Charades 数据集上可取得与现有最先进方法相当或更好的结果。
引用
@article{arxiv.1811.07519,
title = {Higher-order Network for Action Recognition},
author = {Kai Hu and Bhiksha Raj},
journal= {arXiv preprint arXiv:1811.07519},
year = {2019}
}