评估强化学习从仿真到现实的迁移能力
机器人学
2021-06-22 v2 机器学习
摘要
从物理仿真中学习机器人控制策略对机器人学界极具吸引力,因为它可通过减少对昂贵真实世界实验的需求,使学习过程更快、更廉价、更安全。然而,将习得行为从仿真直接迁移到现实是一项重大挑战。在略有缺陷的仿真器上优化策略很容易导致“仿真优化偏差”(SOB)的最大化。此时,优化器会利用仿真器的建模误差,从而使所得行为可能损坏机器人。我们通过应用域随机化(即在学习过程中随机化物理仿真参数)来应对这一挑战。我们提出一种称为带迁移能力评估的基于仿真的策略优化(SPOTA)算法,该算法利用 SOB 的估计量来制定训练的停止准则。所引入的估计量量化了训练时对所经历域集合的过拟合。我们在两个不同二阶非线性系统上的实验结果表明,这种新的基于仿真的策略搜索算法能够仅从随机化仿真器中学习控制策略,并可不经任何额外训练直接应用于真实系统。
引用
@article{arxiv.1907.04685,
title = {Assessing Transferability from Simulation to Reality for Reinforcement Learning},
author = {Fabio Muratore and Michael Gienger and Jan Peters},
journal= {arXiv preprint arXiv:1907.04685},
year = {2021}
}