ACTION-Net:用于动作识别的多路径激励
计算机视觉与模式识别
2021-03-15 v1
摘要
时空、通道与运动模式是视频动作识别中三类互补且关键的信息。常规 2D CNN 计算成本低但无法捕捉时间关系;3D CNN 可取得良好性能但计算密集。本工作中,我们通过设计一个可嵌入 2D CNN 的通用且有效的模块来解决这一困境。为此,我们提出一个时空、通道与运动激励(ACTION)模块,由三条路径组成:时空激励(STE)路径、通道激励(CE)路径和运动激励(ME)路径。STE 路径采用一个通道 3D 卷积来刻画时空表示。CE 路径通过在时间方面显式建模通道间相互依赖关系,自适应地重校准通道级特征响应。ME 路径计算特征级时间差分,并用以激励运动敏感通道。我们为 2D CNN 配备所提 ACTION 模块,以形成简单而有效的 ACTION-Net,其额外计算成本极为有限。ACTION-Net 在三个骨干网络(即 ResNet-50、MobileNet V2 和 BNInception)采用三个数据集(即 Something-Something V2、Jester 和 EgoGesture)上持续优于 2D CNN 对应模型,得以验证。代码见 \url{https://github.com/V-Sense/ACTION-Net}。
引用
@article{arxiv.2103.07372,
title = {ACTION-Net: Multipath Excitation for Action Recognition},
author = {Zhengwei Wang and Qi She and Aljosa Smolic},
journal= {arXiv preprint arXiv:2103.07372},
year = {2021}
}
备注
To appear in CVPR 2021