主动域随机化
机器学习
2019-07-12 v2 人工智能
机器人学
摘要
域随机化是一种常用的改进域迁移的技术,常在目标域未知或难以用于训练的零样本设定下使用。本文中,我们实证考察了域随机化对智能体泛化的影响。我们的实验表明,域随机化可能导致次优、高方差的策略,我们将其归因于环境参数的均匀采样。我们提出主动域随机化(Active Domain Randomization),一种学习参数采样策略的新算法。我们的方法通过利用随机化与参考环境实例中策略 rollout 的差异,在给定随机化范围内寻找信息量最大的环境变化。我们发现更频繁地在这些实例上训练可带来更好的整体智能体泛化。我们在各类基于物理的模拟与真实机器人任务上的实验表明,该增强带来了更鲁棒、更一致的策略。
引用
@article{arxiv.1904.04762,
title = {Active Domain Randomization},
author = {Bhairav Mehta and Manfred Diaz and Florian Golemo and Christopher J. Pal and Liam Paull},
journal= {arXiv preprint arXiv:1904.04762},
year = {2019}
}
备注
Code available at https://github.com/montrealrobotics/active-domainrand