中文

使用深度层次网络生成长时序轨迹

机器学习 2017-06-23 v1

摘要

我们研究利用专家演示对长时间范围内的时空轨迹进行建模的问题。例如,在体育运动中,智能体通常会选择具有长期目标的动作序列,如达到某个战略位置。传统的策略学习方法,例如基于马尔可夫决策过程的方法,通常无法在这种高维状态空间中学习连贯的长期行为,并且仅在短视建模能导致期望行为时才有效。关键困难在于传统方法是“浅层”模型,仅学习单一的状态-动作策略。我们转而提出一种层次策略类,它能自动推理长期和短期目标,并将其实例化为一个层次神经网络。我们在一个学习模仿演示篮球轨迹的案例研究中展示了我们的方法,并表明,根据专业体育分析师的评判,与非层次基线相比,它生成了显著更真实的轨迹。

关键词

引用

@article{arxiv.1706.07138,
  title  = {Generating Long-term Trajectories Using Deep Hierarchical Networks},
  author = {Stephan Zheng and Yisong Yue and Patrick Lucey},
  journal= {arXiv preprint arXiv:1706.07138},
  year   = {2017}
}

备注

Published in NIPS 2016