时间片段网络:迈向深度动作识别的良好实践
计算机视觉与模式识别
2016-08-03 v1
摘要
深度卷积网络在静态图像的视觉识别方面取得了巨大成功。然而,在视频动作识别方面,其相对于传统方法的优势并不明显。本文旨在发现为视频动作设计有效 ConvNet 架构的原则,并在有限训练样本下学习这些模型。我们的第一个贡献是时间片段网络 (TSN),这是一种基于长程时间结构建模思想的新型视频动作识别框架。它结合了稀疏时间采样策略和视频级监督,以利用整个动作视频进行高效且有效的学习。另一个贡献是我们借助时间片段网络对在视频数据上学习 ConvNets 的一系列良好实践的研究。我们的方法在 HMDB51 () 和 UCF101 () 数据集上获得了 state-of-the-art 性能。我们还可视化了学习到的 ConvNet 模型,定性地展示了时间片段网络和所提出的良好实践的有效性。
引用
@article{arxiv.1608.00859,
title = {Temporal Segment Networks: Towards Good Practices for Deep Action Recognition},
author = {Limin Wang and Yuanjun Xiong and Zhe Wang and Yu Qiao and Dahua Lin and Xiaoou Tang and Luc Van Gool},
journal= {arXiv preprint arXiv:1608.00859},
year = {2016}
}
备注
Accepted by ECCV 2016. Based on this method, we won the ActivityNet challenge 2016 in untrimmed video classification