促使LSTM极早预测动作
计算机视觉与模式识别
2017-08-16 v3
摘要
与给定完整序列识别动作的广泛研究问题不同,动作预测旨在仅根据部分可用的视频来识别动作。因此,这对于需要尽可能早做出反应的计算机视觉应用(如自主导航)的成功至关重要。本文提出一种新的动作预测方法,即使在视频序列可用比例极小的情况下也能实现高预测精度。为此,我们开发了利用上下文感知与动作感知特征的多级LSTM架构,并引入一种新的损失函数,鼓励模型尽可能早地预测正确类别。我们在标准基准数据集上的实验证明了该方法的好处;相较于最先进的早期预测动作预测方法,我们在 JHMDB-21 上准确率相对提升 22.0%,在 UT-Interaction 上提升 14.0%,在 UCF-101 上提升 49.9%。
引用
@article{arxiv.1703.07023,
title = {Encouraging LSTMs to Anticipate Actions Very Early},
author = {Mohammad Sadegh Aliakbarian and Fatemeh Sadat Saleh and Mathieu Salzmann and Basura Fernando and Lars Petersson and Lars Andersson},
journal= {arXiv preprint arXiv:1703.07023},
year = {2017}
}
备注
13 Pages, 7 Figures, 11 Tables. Accepted in ICCV 2017. arXiv admin note: text overlap with arXiv:1611.05520