中文

克服 Sim-to-Real 差距:利用仿真学习探索以用于真实世界强化学习

机器学习 2024-10-29 v1 机器人学 机器学习

摘要

为了降低真实世界强化学习的样本复杂度,通常的做法是首先在样本廉价的模拟器中训练策略,然后将该策略部署到真实世界中,期望其能有效地泛化。然而,这种直接 sim2real 迁移并不保证成功,并且在失败的情况下,如何最好地利用模拟器尚不清楚。在本工作中,我们表明在许多情况下,虽然直接 sim2real 迁移可能失败,但我们可以利用模拟器学习一组探索性策略,从而在真实世界中实现高效探索。具体而言,在低秩 MDP 设定下,我们表明将这些探索性策略与简单实用的方法——最小二乘回归预言机和朴素随机探索——相结合,可在真实世界中实现多项式样本复杂度,这比直接 sim2real 迁移或在没有模拟器访问权限下的学习有指数级提升。据我们所知,这是在直接 sim2real 迁移失败的设定下,仿真迁移在强化学习中产生可证明增益的首个证据。我们在几个逼真的机器人模拟器和真实的机器人 sim2real 任务上验证了我们的理论结果,证明迁移探索性策略在实践中也能产生显著的收益。

关键词

引用

@article{arxiv.2410.20254,
  title  = {Overcoming the Sim-to-Real Gap: Leveraging Simulation to Learn to Explore for Real-World RL},
  author = {Andrew Wagenmaker and Kevin Huang and Liyiming Ke and Byron Boots and Kevin Jamieson and Abhishek Gupta},
  journal= {arXiv preprint arXiv:2410.20254},
  year   = {2024}
}

备注

NeurIPS 2024