机器人中强化学习策略Sim2Real迁移后的安全持续域适应
机器人学
2025-03-17 v1 人工智能
摘要
域随机化已成为强化学习(RL)中的一项基础技术,用于促进策略从仿真向真实世界机器人应用的迁移。现有许多域随机化方法被提出以提高鲁棒性和sim2real迁移。这些方法依赖宽泛的随机化范围来补偿未知的实际系统参数,导致生成鲁棒但低效的真实世界策略。此外,在域随机化仿真中预训练的策略在部署后是固定的,这是由于基于RL的优化过程固有的不稳定性,以及有必要在实际系统上采样探索性但可能不安全的动作。这限制了已部署策略对随时间不可避免地变化的系统参数或环境动力学的适应能力。我们利用域随机化仿真下的安全RL和持续学习来解决这些限制,并实现真实世界机器人控制中安全的部署时策略适应。实验表明,我们的方法使策略能够适应并拟合真实系统的当前域分布和环境动力学,同时将安全风险降至最低,并避免了预训练阶段在随机化仿真中发现的通用策略灾难性遗忘等问题。视频和补充材料可在 https://safe-cda.github.io/ 获取。
关键词
引用
@article{arxiv.2503.10949,
title = {Safe Continual Domain Adaptation after Sim2Real Transfer of Reinforcement Learning Policies in Robotics},
author = {Josip Josifovski and Shangding Gu and Mohammadhossein Malmir and Haoliang Huang and Sayantan Auddy and Nicolás Navarro-Guerrero and Costas Spanos and Alois Knoll},
journal= {arXiv preprint arXiv:2503.10949},
year = {2025}
}
备注
8 pages, 5 figures, under review