用于视频动作识别的协作时空特征学习
计算机视觉与模式识别
2019-03-05 v1
摘要
时空特征学习对于视频中的动作识别至关重要。现有的深度神经网络模型要么独立学习空间和时间特征(C2D),要么以无约束参数联合学习(C3D)。在本文中,我们提出一种新颖的神经操作,通过对可学习参数施加权重共享约束来协作编码时空特征。具体而言,我们沿体积视频数据的三个正交视图执行 2D 卷积,分别学习空间外观和时间运动线索。通过共享不同视图的卷积核,空间和时间特征被协作学习,从而相互受益。这些互补特征随后通过端到端学习的系数加权求和进行融合。我们的方法在大规模基准上取得了 SOTA 性能,并在 Moments in Time Challenge 2018 中获得第一名。此外,基于不同视图的学习系数,我们能够量化空间和时间特征的贡献。这一分析为模型的可解释性提供了启示,也可能指导未来视频识别算法的设计。
引用
@article{arxiv.1903.01197,
title = {Collaborative Spatio-temporal Feature Learning for Video Action Recognition},
author = {Chao Li and Qiaoyong Zhong and Di Xie and Shiliang Pu},
journal= {arXiv preprint arXiv:1903.01197},
year = {2019}
}
备注
CVPR 2019