中文

在线与离线自适应域随机化基准测试

机器人学 2022-06-30 v1 机器学习

摘要

物理仿真器在安全、无约束环境中便捷地学习强化学习策略方面已展现出巨大潜力。然而,由于现实差距,将习得的知识迁移到真实世界可能具有挑战性。为此,近期提出了若干方法,利用给定真实数据的后验分布自动调整仿真器参数,以便在训练时与域随机化结合使用。这些方法已在不同的设定与假设下被证明适用于多种机器人任务。尽管如此,现有文献缺乏对已自适应域随机化方法在迁移性能和真实数据效率方面的透彻比较。在本工作中,我们提出一个面向离线及在线方法(SimOpt、BayRn、DROID、DROPO)的开放基准,以阐明哪些方法最适合手头的特定设定与任务。我们发现,在线方法受限于当前所学习策略在下一轮迭代中的质量,而离线方法在仿真中以开环指令重放轨迹时有时可能失败。所用代码将在 https://github.com/gabrieletiboni/adr-benchmark 发布。

关键词

引用

@article{arxiv.2206.14661,
  title  = {Online vs. Offline Adaptive Domain Randomization Benchmark},
  author = {Gabriele Tiboni and Karol Arndt and Giuseppe Averta and Ville Kyrki and Tatiana Tommasi},
  journal= {arXiv preprint arXiv:2206.14661},
  year   = {2022}
}

备注

15 pages, 6 figures