基于在线逆强化学习的第一人称活动预测
计算机视觉与模式识别
2017-08-08 v3
摘要
我们解决了渐进式建模和预测第一人称相机佩戴者长期目标的问题:用户将做什么、将去哪里以及寻求什么目标。与先前在轨迹预测方面的工作不同,我们的算法 DARKO 更进一步地对语义状态(我会捡起一个物体吗?)以及在空间和时间上都相距甚远的未来目标状态进行推理。DARKO 通过在线逆强化学习(Online IRL)方法,从用户日常行为的第一人称视觉观察中进行学习和预测。经典的 IRL 仅在批处理设置中发现奖励,而 DARKO 则从流数据中发现用户的状态、转移、奖励和目标。在其他结果中,我们表明 DARKO 在噪声和理想设置下都比竞争方法更好地预测目标,并且我们的方法在理论和经验上都是无遗憾的。
引用
@article{arxiv.1612.07796,
title = {First-Person Activity Forecasting with Online Inverse Reinforcement Learning},
author = {Nicholas Rhinehart and Kris M. Kitani},
journal= {arXiv preprint arXiv:1612.07796},
year = {2017}
}
备注
To appear at ICCV 2017 (Oral)