基于贝叶斯优化的数据高效域随机化
机器学习
2021-06-22 v4 机器学习
摘要
在学习机器人控制策略时,所需的真实世界数据通常昂贵得难以获取,因此在仿真中学习成为流行策略。不幸的是,由于仿真与现实之间的不匹配(称为“现实鸿沟”),此类策略往往无法迁移至真实世界。域随机化方法通过在训练期间依据域参数的分布随机化物理仿真器(源域),从而获得能够克服现实鸿沟的更鲁棒策略。多数域随机化方法从固定分布中采样域参数。该方案在仿真到现实的可迁移性背景下是次优的,因为它产生的策略在训练时并未显式优化真实系统(目标域)上的奖励。此外,固定分布假设了关于域参数不确定性的先验知识。本文中,我们提出贝叶斯域随机化(BayRn),一种黑盒仿真到现实算法,其在给定来自真实世界目标域的稀疏数据下,通过学习过程中自适应调整域参数分布来高效完成任务。BayRn使用贝叶斯优化搜索源域分布参数的空间,从而导出最大化真实世界目标的策略,允许在策略优化期间进行自适应分布。我们在仿真到仿真以及仿真到现实实验中实验验证了所提方法,并在两项机器人任务上与三种基线方法比较。结果表明,BayRn能够实现仿真到现实迁移,同时显著减少对先验知识的需求。
引用
@article{arxiv.2003.02471,
title = {Data-efficient Domain Randomization with Bayesian Optimization},
author = {Fabio Muratore and Christian Eilers and Michael Gienger and Jan Peters},
journal= {arXiv preprint arXiv:2003.02471},
year = {2021}
}
备注
Accepted at RA-L / ICRA