你何时会做什么?——预测活动的时间发生
计算机视觉与模式识别
2018-04-04 v1
摘要
近年来,分析视频中的人类动作受到了越来越多的关注。虽然大多数工作侧重于对观察到的视频帧进行分类和标注或预测极近的未来,但进行超过几秒钟的长期预测是一项具有许多实际应用且尚未得到解决的任务。在本文中,我们提出了两种方法来预测大量未来动作及其持续时间。CNN 和 RNN 均被训练以基于先前观察到的内容学习未来的视频标签。我们表明,即使对于包含大量不同动作的长视频,我们的方法也能生成准确的未来预测,甚至可以处理含噪或错误的输入信息。
引用
@article{arxiv.1804.00892,
title = {When will you do what? - Anticipating Temporal Occurrences of Activities},
author = {Yazan Abu Farha and Alexander Richard and Juergen Gall},
journal= {arXiv preprint arXiv:1804.00892},
year = {2018}
}
备注
CVPR 2018