中文

用于高效动作识别的长短时域建模

计算机视觉与模式识别 2021-07-01 v1

摘要

高效的长短时域建模是提升动作识别任务性能的关键。本文提出一种称为 MENet 的新型双流动作识别网络,由运动增强(ME)模块和视频级聚合(VLA)模块组成,以实现长短时域建模。具体而言,运动表征已被证明在捕获短期和高频动作方面有效。然而,当前的运动表征由相邻帧计算而得,可能解释性差并带来无用信息(噪声或空白)。因此,对于短期运动,我们设计了一个高效的 ME 模块,通过混合相邻片段间的运动显著性来增强短期运动。对于长期聚合,VLA 被置于外观分支顶端以整合跨所有片段的长期依赖。MENet 的两个组件在时域建模上互补。在 UCF101 和 HMDB51 基准上进行了大量实验,验证了我们所提 MENet 的有效性与高效性。

关键词

引用

@article{arxiv.2106.15787,
  title  = {Long-Short Temporal Modeling for Efficient Action Recognition},
  author = {Liyu Wu and Yuexian Zou and Can Zhang},
  journal= {arXiv preprint arXiv:2106.15787},
  year   = {2021}
}

备注

Accepted by ICASSP 2021