NUTA:用于动作识别的非均匀时间聚合
计算机视觉与模式识别
2020-12-16 v1
摘要
在动作识别研究领域,一个主要焦点是如何构建和训练网络以建模输入视频的时空体。这些方法通常对输入片段(沿时间维度)均匀采样一段。然而,并非视频的所有部分对确定片段中的动作同等重要。在本工作中,我们转而关注于学习在何处提取特征,以聚焦于视频中信息量最大的部分。我们提出一种称为非均匀时间聚合(NUTA)的方法,其仅从信息性时间片段聚合特征。我们还引入一种同步方法,使我们的 NUTA 特征能与传统均匀采样视频特征在时间上对齐,从而可结合局部与片段级特征。我们的模型在四个广泛使用的大规模动作识别数据集(Kinetics400、Kinetics700、Something-something V2 和 Charades)上取得了最先进的性能。此外,我们制作了可视化以说明所提 NUTA 方法如何仅选择视频片段中最相关的部分。
引用
@article{arxiv.2012.08041,
title = {NUTA: Non-uniform Temporal Aggregation for Action Recognition},
author = {Xinyu Li and Chunhui Liu and Bing Shuai and Yi Zhu and Hao Chen and Joseph Tighe},
journal= {arXiv preprint arXiv:2012.08041},
year = {2020}
}