中文

用于视频动作识别的层次特征聚合网络

计算机视觉与模式识别 2019-05-30 v1

摘要

大多数动作识别方法基于 a) 使用平均池化、最大池化或 RNN 等对帧级 CNN 特征进行后期聚合,或 b) 通过 3D 卷积进行时空聚合。前者假设帧特征在某一抽象层级之前相互独立,再进行更高层级的聚合,而后者作为早期融合从成组帧中提取时空特征。在本文中,我们探索这两者之间的空间,让相邻特征分支在发展为更高层表示时相互作用。该相互作用发生在层次每一层上的特征差分与平均之间,并且具有卷积结构,学会在局部选择合适的模式,与先前将某种模式(如特征差分)作为设计选择全局强加的工作形成对比。我们进一步约束该相互作用为保守的,例如一个分支中的局部特征相减由另一分支中的相加补偿,从而总特征流得以保持。我们在若干现有模型(即 TSN、TRN 和 ECO)上评估了我们提案的性能,以展示其在提升动作识别性能方面的灵活性与有效性。

关键词

引用

@article{arxiv.1905.12462,
  title  = {Hierarchical Feature Aggregation Networks for Video Action Recognition},
  author = {Swathikiran Sudhakaran and Sergio Escalera and Oswald Lanz},
  journal= {arXiv preprint arXiv:1905.12462},
  year   = {2019}
}