面向视频理解的端到端运动表示学习
计算机视觉与模式识别
2018-04-03 v1
摘要
尽管端到端学习表示近期取得成功,手工设计的光流特征仍广泛用于视频分析任务。为弥补这一差距,我们提出 TVNet,一种新颖的端到端可训练神经网络,从数据中学习类光流特征。TVNet 包含了一种特定的光流求解器,即 TV-L1 方法,并通过将其优化迭代展开为神经层来进行初始化。因此 TVNet 可直接使用而无需额外学习。此外,它可自然地与其它任务特定网络拼接以构成端到端架构,从而避免预先在磁盘上计算和存储特征,使我们的方法比当前多阶段方法更高效。最后,TVNet 的参数可通过端到端训练进一步微调,使其能学习超越精确光流的更丰富且任务特定的模式。在两个动作识别基准上的大量实验验证了所提方法的有效性。我们的 TVNet 取得了优于所有对比方法的准确率,同时在特征提取时间上与最快的对手相当。
引用
@article{arxiv.1804.00413,
title = {End-to-End Learning of Motion Representation for Video Understanding},
author = {Lijie Fan and Wenbing Huang and Chuang Gan and Stefano Ermon and Boqing Gong and Junzhou Huang},
journal= {arXiv preprint arXiv:1804.00413},
year = {2018}
}
备注
CVPR 2018 spotlight. The first two authors contributed equally to this paper