MotionSqueeze:用于视频理解的神经运动特征学习
计算机视觉与模式识别
2020-07-21 v1
摘要
运动在视频理解中起着关键作用,当前大多数先进的视频分类神经模型通常利用由独立现成方法提取的光流来融入运动信息。由于逐帧光流需要繁重计算,融入运动信息一直是视频理解的主要计算瓶颈。本工作中,我们用内部轻量级的运动特征学习替代外部繁重的光流计算。我们提出一个称为 MotionSqueeze 的可训练神经模块,用于高效运动特征提取。它插入任意神经网络中部,学习建立跨帧对应并将其转换为运动特征,直接送入下一下游层以改进预测。我们证明,所提方法在四个动作识别标准基准上以仅少量额外代价带来显著增益,并在 Something-Something-V1&V2 数据集上优于当前最优。
引用
@article{arxiv.2007.09933,
title = {MotionSqueeze: Neural Motion Feature Learning for Video Understanding},
author = {Heeseung Kwon and Manjin Kim and Suha Kwak and Minsu Cho},
journal= {arXiv preprint arXiv:2007.09933},
year = {2020}
}
备注
Accepted to ECCV 2020