中文

通过熵最大化的域随机化

机器学习 2024-03-27 v2 机器人学

摘要

在仿真中改变动力学参数是克服强化学习(RL)中现实差距的一种流行域随机化(DR)方法。然而,DR 严重依赖于动力学参数采样分布的选择,因为高变异性对于正则化智能体行为至关重要,但过度随机化时却以 notorious 方式导致过于保守的策略。本文提出一种解决仿真到现实迁移的新方法,其在仿真训练中自动塑造动力学分布而无需真实世界数据。我们引入通过熵最大化的域随机化(DORAEMON),这是一个在保持泛化能力的同时直接最大化训练分布熵的约束优化问题。由此,DORAEMON 在当前策略成功概率足够高时逐步增加采样动力学参数的多样性。我们经验性地验证了 DORAEMON 在获得高适应性与可泛化策略(即在最宽动力学参数范围内解决手头任务)方面的一致优势,优于 DR 文献中的代表性基线。值得注意的是,我们还通过其在未知真实世界参数下机器人操作设置中的成功零样本迁移展示了 DORAEMON 的 Sim2Real 适用性。

关键词

引用

@article{arxiv.2311.01885,
  title  = {Domain Randomization via Entropy Maximization},
  author = {Gabriele Tiboni and Pascal Klink and Jan Peters and Tatiana Tommasi and Carlo D'Eramo and Georgia Chalvatzaki},
  journal= {arXiv preprint arXiv:2311.01885},
  year   = {2024}
}

备注

Published as a conference paper at ICLR 2024. Project website at https://gabrieletiboni.github.io/doraemon/