Uni-O4:通过多步同策略优化统一在线与离线深度强化学习
机器学习
2024-03-19 v4 机器人学
摘要
结合离线(offline)与在线(online)强化学习(RL)对于高效且安全的学习至关重要。然而,以往的方法将离线与在线学习视为独立过程,导致设计冗余且性能受限。我们提出:能否在不引入额外保守性或正则化的情况下,实现简洁而有效的离线与在线学习?在本研究中,我们提出Uni-o4,它对离线与在线学习均采用同策略(on-policy)目标。由于两阶段目标的对齐,RL智能体可在离线与在线学习之间无缝迁移。该特性增强了学习范式的灵活性,允许预训练、微调、离线与在线学习的任意组合。具体而言,在离线阶段,Uni-o4利用多样化的集成策略来解决估计行为策略与离线数据集之间的不匹配问题。通过简单的离线策略评估(OPE)方法,Uni-o4能够安全地实现多步策略改进。我们证明,采用上述方法,这两种范式的融合可产生优越的离线初始化以及稳定且快速的在线微调能力。通过真实世界机器人任务,我们凸显了该范式在具有挑战性、此前未见的真实环境中快速部署的优势。此外,通过大量仿真基准的综合评估,我们证实我们的方法在离线及离线到在线微调学习中均达到最先进(SOTA)性能。我们的网站:https://lei-kun.github.io/uni-o4/ 。
引用
@article{arxiv.2311.03351,
title = {Uni-O4: Unifying Online and Offline Deep Reinforcement Learning with Multi-Step On-Policy Optimization},
author = {Kun Lei and Zhengmao He and Chenhao Lu and Kaizhe Hu and Yang Gao and Huazhe Xu},
journal= {arXiv preprint arXiv:2311.03351},
year = {2024}
}
备注
Our website: https://lei-kun.github.io/uni-o4/