用于视频中人体动作识别的多时态卷积
计算机视觉与模式识别
2021-04-01 v2
摘要
有效提取时间模式对于识别视频中随时间变化的动作至关重要。我们认为,卷积神经网络(CNNs)中使用的固定尺寸时空卷积核可以改进,以提取在不同时间尺度上执行的信息性运动。为应对这一挑战,我们提出了一种新颖的时空卷积块,能够在多种时间分辨率下提取时空模式。我们提出的多时态卷积(MTConv)块利用两个分支分别聚焦于短暂和持久的时空模式。提取的时变特征在第三分支中通过循环单元相对于全局运动模式进行对齐。所提出的块轻量且可集成到任何 3D-CNN 架构中,这大幅降低了计算成本。在 Kinetics、Moments in Time 和 HACS 动作识别基准数据集上的大量实验表明,MTConv 以显著更低的计算开销取得了与最先进方法(state-of-the-art)相比具有竞争力的性能。
引用
@article{arxiv.2011.03949,
title = {Multi-Temporal Convolutions for Human Action Recognition in Videos},
author = {Alexandros Stergiou and Ronald Poppe},
journal= {arXiv preprint arXiv:2011.03949},
year = {2021}
}