中文

Sim2Real 学习的权衡:真实世界学习快于仿真

机器人学 2022-01-11 v4 人工智能 机器学习

摘要

深度强化学习(DRL)实验通常在仿真环境中进行,因为深度神经网络需要海量的训练样本。相比之下,基于模型的贝叶斯学习使机器人能在真实世界中通过少量试验学习到良好策略。尽管迭代次数更少,贝叶斯方法每次试验的计算成本相对较高,且此类方法的优势与维度和噪声密切相关。在此,我们将一种深度贝叶斯学习算法与一种无模型 DRL 算法进行比较,同时分析从仿真与真实世界实验中收集的结果。在考虑仿真(Sim)与真实(Real)学习时,我们的实验表明,即便将计算时间(而非迭代次数)纳入考量,样本高效的深度贝叶斯 RL 性能仍优于 DRL。此外,仿真与实验中深度贝叶斯 RL 的计算时间差异指向了一条跨越现实鸿沟的可行路径。我们还表明,仿真与真实混合的方法并不优于纯真实方法,这暗示真实世界或许能为贝叶斯学习提供最佳先验知识。机器人学家每日设计与制造机器人,我们的结果表明,真实世界中更高的学习效率可通过跳过仿真来缩短从设计到部署的时间。

关键词

引用

@article{arxiv.2007.10675,
  title  = {Trade-off on Sim2Real Learning: Real-world Learning Faster than Simulations},
  author = {Jingyi Huang and Yizheng Zhang and Fabio Giardina and Andre Rosendo},
  journal= {arXiv preprint arXiv:2007.10675},
  year   = {2022}
}

备注

To be published in 2022 8th International Conference on Control, Automation and Robotics (ICCAR)