DROPO:基于离线域随机化的模拟到真实迁移
机器人学
2023-01-13 v2 机器学习
摘要
近年来,针对动力学参数的域随机化作为一种机器人操作中强化学习策略模拟到真实(sim-to-real)迁移的方法获得了大量关注;然而,寻找最优随机化分布可能十分困难。在本文中,我们提出 DROPO,一种用于估计安全模拟到真实迁移的域随机化分布的新方法。与先前工作不同,DROPO 仅需要有限的、预先收集的离线轨迹数据集,并显式建模参数不确定性以使用基于似然的方法匹配真实数据。我们证明 DROPO 能够在仿真中恢复动态参数分布,并找到可补偿未建模现象的分布。我们还在两个零样本模拟到真实迁移场景中评估该方法,展示了成功的域迁移及相对于先前方法的性能提升。
引用
@article{arxiv.2201.08434,
title = {DROPO: Sim-to-Real Transfer with Offline Domain Randomization},
author = {Gabriele Tiboni and Karol Arndt and Ville Kyrki},
journal= {arXiv preprint arXiv:2201.08434},
year = {2023}
}
备注
16 pages, 21 figures