中文

基于模型的动作探索用于学习动态运动技能

人工智能 2018-04-13 v2

摘要

深度强化学习在解决具有挑战性的运动控制任务方面取得了巨大进展。近来,关于利用训练过程中收集的数据的方法已有大量工作,但关于如何最佳地生成用于学习的数据的研究则较少。对于连续动作域,生成探索性动作最常用的方法是从以策略输出的平均动作为中心的高斯分布中采样。尽管这些方法相当有能力,但它们不能很好地随动作空间维数扩展,并且在硬件上应用可能存在危险。我们考虑学习一个前向动力学模型,以在给定特定状态观测 (xtx_{t}) 时预测采取特定动作 (uu) 的结果 (xt+1x_{t+1})。利用该模型,我们执行内部前瞻结果预测,并寻找我们认为有合理成功机会的动作。该方法改变了探索性动作空间,从而提高了学习速度,并能够为诸如机器人行走和抛接等难题提供更高质量的解决方案。

关键词

引用

@article{arxiv.1801.03954,
  title  = {Model-Based Action Exploration for Learning Dynamic Motion Skills},
  author = {Glen Berseth and Michiel van de Panne},
  journal= {arXiv preprint arXiv:1801.03954},
  year   = {2018}
}

备注

7 pages, 7 figures, conference paper