中文

在仿真上验证,在真实上检测——面向域随机化的模型选择

机器人学 2022-03-02 v3 人工智能 机器学习

摘要

一种实用的机器人技能学习方法(常称为 sim2real)是在仿真中训练控制策略,然后将其部署到真实机器人上。改善 sim2real 迁移的流行技术建立在域随机化(DR)之上——在多样化随机生成域上训练策略,以期更好地泛化到真实世界。由于策略学习和 DR 算法中均有大量超参数,人们往往得到大量训练好的策略,而从中选择最佳策略需要在真实机器人上进行代价高昂的评估。本工作中我们提问——能否在不于真实世界运行这些策略的情况下对它们排序?我们的主要思想是,一组预定义的真实世界数据可用于评估所有策略,使用分布外检测(OOD)技术。在某种意义上,该方法可视为在任何真实世界执行前评估策略的“单元测试”。然而,我们发现 OOD 分数本身可能不准确且对特定 OOD 方法非常敏感。我们的主要贡献是一个简单而有效的策略分数,将 OOD 与仿真中评估相结合。我们表明,我们的分数——VSDR——能在不需要额外真实世界数据的情况下显著提升策略排序的准确性。我们在带有图像输入的机器人抓取任务中的 sim2real 迁移上评估了 VSDR 的有效性。我们广泛评估了不同的 DR 参数和 OOD 方法,并表明 VSDR 全面改善了策略选择。更重要的是,与基线相比,我们的方法实现了显著更好的排序,且使用显著更少的数据。项目网站位于 https://sites.google.com/view/vsdr/home。

关键词

引用

@article{arxiv.2111.00765,
  title  = {Validate on Sim, Detect on Real -- Model Selection for Domain Randomization},
  author = {Gal Leibovich and Guy Jacob and Shadi Endrawis and Gal Novik and Aviv Tamar},
  journal= {arXiv preprint arXiv:2111.00765},
  year   = {2022}
}

备注

Updates following feedback from ICRA reviewers. Accepted to ICRA 2022