中文

通过学习任务语法进行人类动作预测

计算机视觉与模式识别 2017-09-20 v1

摘要

为了实现有效的人机交互,机器人助手能够预测人类在给定任务中将要考虑的下一个动作是至关重要的。遗憾的是,现实世界中的任务通常非常长、复杂且重复;因此预测并非易事。在本文中,我们提出了一种新颖的深度循环架构,该架构以双流 Residual 动作识别框架提取的特征作为输入,并学习从视频序列中估计人类活动的进度——这一替代性的进度估计任务隐式地学习了一种时间任务语法,据此可以对活动进行定位和预测。为了学习任务语法,我们提出了一个基于堆叠 LSTM 的多粒度进度估计框架,该框架使用一种新颖的累积欧几里得损失作为目标。为了证明我们提出的架构的有效性,我们在两个具有挑战性的机器人辅助任务上展示了实验,即 组装一张宜家桌子以及 更换汽车轮胎。我们的结果表明,学习任务语法提供了高度具有判别性的线索,使预测准确率比基线双流预测模型提高了 9% 以上,同时也优于其他竞争方案。

关键词

引用

@article{arxiv.1709.06391,
  title  = {Human Action Forecasting by Learning Task Grammars},
  author = {Tengda Han and Jue Wang and Anoop Cherian and Stephen Gould},
  journal= {arXiv preprint arXiv:1709.06391},
  year   = {2017}
}