基于运动学域随机化与适应的策略迁移
机器人学
2021-04-05 v3 机器学习
系统与控制
系统与控制
摘要
将物理仿真中训练的强化学习策略迁移到真实硬件上仍是一项挑战,即所谓的“仿真到真实”鸿沟。域随机化是一种简单而有效的技术,用于解决源域与目标域之间的动力学差异,但其成功通常依赖启发式方法和试错。本工作中我们研究了随机化参数选择对不同类型域差异下策略可迁移性的影响。与通常仔细测量运动学参数而随机化动力学参数的常见做法相反,我们发现训练时在仿真中虚拟随机化运动学参数(如连杆长度)一般优于动力学随机化。基于该发现,我们引入了一种利用仿真运动学参数变化的新域适应算法。我们的算法——多策略贝叶斯优化,训练以虚拟运动学参数为条件的通用策略集成,并使用有限数量的目标域 rollout 高效适应目标环境。我们在仿真四足机器人上展示了我们的发现,涵盖五种不同的目标环境,涉及域差异的不同方面。
引用
@article{arxiv.2011.01891,
title = {Policy Transfer via Kinematic Domain Randomization and Adaptation},
author = {Ioannis Exarchos and Yifeng Jiang and Wenhao Yu and C. Karen Liu},
journal= {arXiv preprint arXiv:2011.01891},
year = {2021}
}
备注
Submitted to the 2021 IEEE International Conference on Robotics and Automation (ICRA)