中文

学习域随机化分布以训练鲁棒运动策略

机器学习 2019-09-18 v2 机器人学 机器学习

摘要

域随机化(DR)是一种在目标机器人系统动力学未知时,为其学习鲁棒策略的成功技术。然而,使用域随机化训练的策略的成功高度依赖于随机化分布的正确选择。大多数成功案例通常利用真实世界数据来仔细选择 DR 分布,或结合真实世界轨迹以更好地估计合适的随机化分布。在本文中,我们考虑在无法预先获取目标系统数据的情况下,为仿真寻找良好的域随机化参数的问题。我们探索使用基于梯度的搜索方法来学习具有以下性质的域随机化:1)训练所得策略在从域随机化分布中采样的环境中应当成功;2)域随机化分布应当足够宽,使得在训练期间观察到类似于目标机器人系统的经验,同时兼顾有限容量模型训练的实际可行性。这两个性质旨在确保目标系统中遇到的轨迹接近于训练期间观察到的轨迹,因为机器学习中的现有方法更适用于插值而非外推。我们展示了在训练上下文条件策略的同时调整域随机化分布,如何在将学习到的策略迁移到目标环境时改善起始跳跃性能和渐近性能。

关键词

引用

@article{arxiv.1906.00410,
  title  = {Learning Domain Randomization Distributions for Training Robust Locomotion Policies},
  author = {Melissa Mozifian and Juan Camilo Gamboa Higuera and David Meger and Gregory Dudek},
  journal= {arXiv preprint arXiv:1906.00410},
  year   = {2019}
}