中文

EAN:用于增强动作识别的事件自适应网络

计算机视觉与模式识别 2022-08-10 v2

摘要

高效地对视频中的时空信息进行建模对动作识别至关重要。为此,最先进的方法通常采用卷积算子与密集交互模块(如非局部块)。然而,这些方法无法精确拟合视频中多样的事件。一方面,所采用的卷积具有固定尺度,因而难以处理不同尺度的事件。另一方面,密集交互建模范式仅取得次优性能,因为与动作无关的部分为最终预测带来了额外噪声。本文提出一个统一的动作识别框架,通过引入如下设计来探究视频内容的动态特性。首先,在提取局部线索时,我们生成动态尺度的时空核以自适应拟合多样事件。其次,为将这些线索准确聚合为全局视频表示,我们提出仅通过 Transformer 在少数选定的前景对象间挖掘交互,从而形成稀疏范式。由于两项关键设计均自适应于输入视频内容,我们称所提框架为事件自适应网络(Event Adaptive Network, EAN)。为利用局部片段内的短时运动,我们提出一种新颖高效的潜运动编码(Latent Motion Code, LMC)模块,进一步提升了框架性能。在数个大规模视频数据集(如 Something-to-Something V1&V2、Kinetics 与 Diving48)上的大量实验证实,我们的模型在低 FLOPs 下取得了最先进或具竞争力的性能。代码见:https://github.com/tianyuan168326/EAN-Pytorch。

关键词

引用

@article{arxiv.2107.10771,
  title  = {EAN: Event Adaptive Network for Enhanced Action Recognition},
  author = {Yuan Tian and Yichao Yan and Guangtao Zhai and Guodong Guo and Zhiyong Gao},
  journal= {arXiv preprint arXiv:2107.10771},
  year   = {2022}
}

备注

IJCV2022 paper. Codes are available at: https://github.com/tianyuan168326/EAN-Pytorch