理解视频中的人类动作需要哪些动作信息?
计算机视觉与模式识别
2017-08-10 v1
摘要
推理人类活动的正确方式是什么?未来最有前景的方向是什么?在本工作中,我们分析了视频中人类活动理解的现状。本文的目标是考察数据集、评估指标、算法以及潜在的未来方向。我们考察了定义活动的定性属性,如姿态可变性、短暂性和密度。实验考虑了多种 SOTA 算法和多个数据集。结果表明,尽管活动的时间范围存在固有的模糊性,但当前的数据集仍然允许有效的基准测试。我们发现,对物体和姿态的细粒度理解与时间推理相结合,可能会在算法准确性上产生实质性改进。我们展示了在活动理解方面要取得实质性进展所需的多种信息:物体、动词、意图和顺序推理。软件和附加信息将被提供,以便为其他研究人员提供详细的诊断,以理解他们自己的算法。
引用
@article{arxiv.1708.02696,
title = {What Actions are Needed for Understanding Human Actions in Videos?},
author = {Gunnar A. Sigurdsson and Olga Russakovsky and Abhinav Gupta},
journal= {arXiv preprint arXiv:1708.02696},
year = {2017}
}
备注
ICCV2017