TS-LSTM 与 Temporal-Inception:利用时空动力学进行活动识别
计算机视觉与模式识别
2017-04-03 v1
摘要
近年来,双流深度卷积神经网络(ConvNets)在视频人体动作识别方面取得了显著进展。尽管取得了成功,但扩展基本双流 ConvNet 的方法尚未系统地探索可能的网络架构,以进一步利用视频序列中的时空动力学。此外,此类网络通常使用不同的基线双流网络。因此,使用循环神经网络(RNN)或在时间构造特征向量上的卷积网络的各种方法之间的差异与区分因素尚不明确。在本工作中,我们首先展示了使用 ResNet-101 的强基线双流 ConvNet。我们使用该基线彻底检验了 RNN 和 Temporal-ConvNet 在提取时空信息方面的应用。基于我们的实验结果,我们随后提出并研究了两种不同的网络以进一步整合时空信息:1)时间片段 RNN 和 2)Inception 风格的 Temporal-ConvNet。我们证明,在时空特征矩阵上使用 RNN(使用 LSTM)和 Temporal-ConvNet 均能利用时空动力学来提升整体性能。然而,这些方法各自均需妥善处理才能达到 SOTA 性能;例如,LSTM 需要预分段数据,否则无法充分利用时间信息。我们的分析指出了每种方法的具体局限性,这可作为未来工作的基础。我们在 UCF101 和 HMDB51 数据集上的实验结果分别达到了 94.1% 和 69.0% 的 SOTA 性能,且无需大量时间数据增强。
引用
@article{arxiv.1703.10667,
title = {TS-LSTM and Temporal-Inception: Exploiting Spatiotemporal Dynamics for Activity Recognition},
author = {Chih-Yao Ma and Min-Hung Chen and Zsolt Kira and Ghassan AlRegib},
journal= {arXiv preprint arXiv:1703.10667},
year = {2017}
}
备注
16 pages, 11 figures