用于动作识别的长期时间卷积
计算机视觉与模式识别
2017-06-05 v2
摘要
典型的人类动作持续数秒并表现出特征的时空结构。最近的方法试图捕捉这种结构并用卷积神经网络学习动作表示。然而,此类表示通常在少数视频帧的层面上学习,未能在完整时间跨度上建模动作。在这项工作中,我们使用具有长期时间卷积(LTC)的神经网络学习视频表示。我们证明具有增加时域范围的 LTC-CNN 模型提高了动作识别的准确率。我们还研究了不同低级表示的影响,例如视频像素的原始值和光流向量场,并展示了高质量光流估计对于学习准确动作模型的重要性。我们在两个人动作识别的挑战性基准 UCF101(92.7%)和 HMDB51(67.2%)上报告了最先进的结果。
引用
@article{arxiv.1604.04494,
title = {Long-term Temporal Convolutions for Action Recognition},
author = {Gül Varol and Ivan Laptev and Cordelia Schmid},
journal= {arXiv preprint arXiv:1604.04494},
year = {2017}
}