用于动作识别的时空融合网络
计算机视觉与模式识别
2019-06-18 v1
摘要
基于视频的CNN工作一直专注于融合外观与运动网络的有效方式,但它们通常缺乏利用视频帧间的时间信息。本文提出一种新颖的时空融合网络(STFN),该网络整合了整个视频中外观与运动信息的时间动态。所捕获的时间动态信息随后被聚合以获得更好的视频级表示,并通过端到端训练进行学习。时空融合网络由两组提取时间动态的残差Inception块以及用于外观与运动特征的融合连接组成。STFN的优势在于:(a) 它捕获互补数据的局部与全局时间动态以学习视频范围的信息;以及 (b) 它适用于任何用于视频分类的网络以提升性能。我们探索了STFN的多种设计选择,并通过消融实验验证了网络性能的变化情况。我们在两个具有挑战性的人体活动数据集UCF101和HMDB51上进行了实验,并利用最佳网络取得了最先进的结果。
引用
@article{arxiv.1906.06822,
title = {Spatio-Temporal Fusion Networks for Action Recognition},
author = {Sangwoo Cho and Hassan Foroosh},
journal= {arXiv preprint arXiv:1906.06822},
year = {2019}
}