通过平衡回放与悲观 Q 集成的离线到在线强化学习
机器人学
2021-11-02 v2 机器学习
摘要
深度离线强化学习(RL)的近期进展使得从离线数据集训练强大的机器人智能体成为可能。然而,取决于所训练智能体的质量与所考虑的应用,通常希望通过进一步的在线交互对这些智能体进行微调。本文中,我们观察到状态-动作分布偏移可能在微调期间导致严重的自举误差,从而破坏通过离线 RL 获得的良好初始策略。为解决此问题,我们首先提出一种平衡回放方案,该方案优先处理在线遇到的样本,同时鼓励使用来自离线数据集的近在线策略样本。此外,我们利用离线阶段以悲观方式训练的多个 Q 函数,从而防止在初始训练阶段对新状态上不熟悉动作过度乐观。我们表明,所提方法在各种运动与操控任务上提升了微调机器人智能体的样本效率与最终性能。我们的代码见:https://github.com/shlee94/Off2OnRL。
引用
@article{arxiv.2107.00591,
title = {Offline-to-Online Reinforcement Learning via Balanced Replay and Pessimistic Q-Ensemble},
author = {Seunghyun Lee and Younggyo Seo and Kimin Lee and Pieter Abbeel and Jinwoo Shin},
journal= {arXiv preprint arXiv:2107.00591},
year = {2021}
}
备注
CoRL 2021. First two authors contributed equally