视频预测性理解综述:早期动作识别与未来动作预测
计算机视觉与模式识别
2021-07-20 v2
摘要
视频预测性理解涵盖广泛的研究工作,这些工作关注基于当前及历史视频观测对未观测未来的预期。动作预测是视频预测性理解的一个主要子领域,也是本综述的重点。该子领域有两个主要分支:早期动作识别与未来动作预测。早期动作识别关注尽快识别正在进行的动作。未来动作预测关注对继先前观测之后所发生动作的预期。无论哪种情况,过去、当前与潜在未来信息之间的因果关系是主要焦点。诸如马尔可夫链、高斯过程、自回归建模与贝叶斯递推滤波等多种数学工具,与计算机视觉技术联合被广泛采用用于这两项任务。然而,这些方法面临维度灾难、泛化能力差以及领域特定知识的约束等挑战。近来,依赖深度卷积神经网络与循环神经网络的结构被大量提出,以总体上改进现有视觉任务、特别是动作预测任务的性能。但它们也有自身缺陷,例如依赖海量训练数据以及缺乏强有力的理论支撑。在本综述中,我们首先介绍视频预测性理解这一广泛领域中近期受到密集关注且被证明具有实用价值的主要子领域。接着,对各类早期动作识别与未来动作预测算法进行详尽综述,并作恰当归类。最后,我们以未来研究方向作结。
引用
@article{arxiv.2107.05140,
title = {Review of Video Predictive Understanding: Early Action Recognition and Future Action Prediction},
author = {He Zhao and Richard P. Wildes},
journal= {arXiv preprint arXiv:2107.05140},
year = {2021}
}