中文

H2O+:一种改进的动态差异混合离线与在线强化学习框架

机器学习 2025-04-17 v2 人工智能 机器人学

摘要

在不具备高保真仿真环境或大量离线数据的情况下,使用强化学习(RL)解决现实世界复杂任务颇具挑战。在不完美仿真环境中训练的在线 RL 智能体可能遭受严重的仿真到现实(sim-to-real)问题。离线 RL 方法虽绕开了仿真器的需求,却往往对离线数据集的规模与质量有严苛要求。近期出现的混合离线与在线 RL 提供了一种颇具吸引力的框架,能够联合利用有限离线数据与不完美仿真器进行可迁移策略学习。本文提出一种称为 H2O+ 的新算法,其具备高度灵活性以衔接各类离线与在线学习方法的组合,同时考虑了真实环境与仿真环境之间的动态差异(dynamics gap)。通过大量仿真与真实机器人实验,我们展示了相较先进的跨域在线与离线 RL 算法更优的性能与灵活性。

关键词

引用

@article{arxiv.2309.12716,
  title  = {H2O+: An Improved Framework for Hybrid Offline-and-Online RL with Dynamics Gaps},
  author = {Haoyi Niu and Tianying Ji and Bingqi Liu and Haocheng Zhao and Xiangyu Zhu and Jianying Zheng and Pengfei Huang and Guyue Zhou and Jianming Hu and Xianyuan Zhan},
  journal= {arXiv preprint arXiv:2309.12716},
  year   = {2025}
}

备注

ICRA 2025