中文

后见状态:融合仿真与真实任务要素以实现高效强化学习

机器人学 2023-03-10 v2 人工智能 机器学习 神经与进化计算

摘要

强化学习在能够以极小代价生成大量数据时,已展现出解决复杂任务的巨大潜力。在机器人领域,一种生成训练数据的方法依赖于基于第一性原理推导的动力学模型的仿真。然而,对于涉及复杂软体机器人等任务,设计此类模型要困难得多。能够随着动力学模型日益复杂用强化学习有效训练,有助于利用软体机器人等复杂系统。在此,我们利用动力学复杂度的不平衡来更高效地学习样本。(i)我们将任务抽象为不同组件,(ii)将简单动力学部分卸载至仿真中,(iii)将这些虚拟部分倍增以在后见中生成更多数据。我们的新方法“后见状态”(HiS)使用这些数据并筛选最有用的转移用于训练。它可与任意离策略算法配合使用。我们在若干具有挑战性的仿真任务上验证了该方法,并证明无论单独使用还是与现有后见算法Hindsight Experience Replay(HER)结合均能改善学习。最后,我们在物理系统上评估HiS,并展示其在肌肉型机器人的复杂乒乓球任务上提升了性能。实验视频与代码见 webdav.tuebingen.mpg.de/his/。

关键词

引用

@article{arxiv.2303.02234,
  title  = {Hindsight States: Blending Sim and Real Task Elements for Efficient Reinforcement Learning},
  author = {Simon Guist and Jan Schneider and Alexander Dittrich and Vincent Berenz and Bernhard Schölkopf and Dieter Büchler},
  journal= {arXiv preprint arXiv:2303.02234},
  year   = {2023}
}