如何为强化学习策略的仿真到真实迁移选取域随机化参数?
机器学习
2019-03-29 v1 人工智能
机器学习
摘要
近来,强化学习(RL)算法已展现出从极少处理的输入中学习复杂行为的显著成功。然而,此类成功大多局限于仿真。尽管将 RL 算法直接应用于真实系统已有可喜成果,但其在更复杂系统上的性能仍受限于 RL 算法相对的数据低效。域随机化是一个有前景的研究方向,已展示出利用 RL 算法控制真实机器人的令人印象深刻的成果。从高层看,域随机化通过在仿真中环境条件的分布上训练策略来工作。若环境足够多样,则在该分布上训练的策略将有望泛化到真实世界。域随机化中由人工指定的设计选择是模拟环境分布的形式与参数。目前尚不清楚如何最佳地选取该分布的形式与参数,且先前工作使用手工调参的分布。本扩展摘要表明,该分布的选择在真实世界中训练策略的性能上起着重要作用,并且该分布的参数可被优化以最大化训练策略在真实世界中的性能。
引用
@article{arxiv.1903.11774,
title = {How to pick the domain randomization parameters for sim-to-real transfer of reinforcement learning policies?},
author = {Quan Vuong and Sharad Vikram and Hao Su and Sicun Gao and Henrik I. Christensen},
journal= {arXiv preprint arXiv:1903.11774},
year = {2019}
}
备注
2-page extended abstract