中文

基于在线逆强化学习的第一人称活动预测

计算机视觉与模式识别 2017-08-08 v3

摘要

我们解决了渐进式建模和预测第一人称相机佩戴者长期目标的问题:用户将做什么、将去哪里以及寻求什么目标。与先前在轨迹预测方面的工作不同,我们的算法 DARKO 更进一步地对语义状态(我会捡起一个物体吗?)以及在空间和时间上都相距甚远的未来目标状态进行推理。DARKO 通过在线逆强化学习(Online IRL)方法,从用户日常行为的第一人称视觉观察中进行学习和预测。经典的 IRL 仅在批处理设置中发现奖励,而 DARKO 则从流数据中发现用户的状态、转移、奖励和目标。在其他结果中,我们表明 DARKO 在噪声和理想设置下都比竞争方法更好地预测目标,并且我们的方法在理论和经验上都是无遗憾的。

关键词

引用

@article{arxiv.1612.07796,
  title  = {First-Person Activity Forecasting with Online Inverse Reinforcement Learning},
  author = {Nicholas Rhinehart and Kris M. Kitani},
  journal= {arXiv preprint arXiv:1612.07796},
  year   = {2017}
}

备注

To appear at ICCV 2017 (Oral)