使用深度层次网络生成长时序轨迹
机器学习
2017-06-23 v1
摘要
我们研究利用专家演示对长时间范围内的时空轨迹进行建模的问题。例如,在体育运动中,智能体通常会选择具有长期目标的动作序列,如达到某个战略位置。传统的策略学习方法,例如基于马尔可夫决策过程的方法,通常无法在这种高维状态空间中学习连贯的长期行为,并且仅在短视建模能导致期望行为时才有效。关键困难在于传统方法是“浅层”模型,仅学习单一的状态-动作策略。我们转而提出一种层次策略类,它能自动推理长期和短期目标,并将其实例化为一个层次神经网络。我们在一个学习模仿演示篮球轨迹的案例研究中展示了我们的方法,并表明,根据专业体育分析师的评判,与非层次基线相比,它生成了显著更真实的轨迹。
引用
@article{arxiv.1706.07138,
title = {Generating Long-term Trajectories Using Deep Hierarchical Networks},
author = {Stephan Zheng and Yisong Yue and Patrick Lucey},
journal= {arXiv preprint arXiv:1706.07138},
year = {2017}
}
备注
Published in NIPS 2016