GOPlan:基于学习模型规划的goal-conditioned离线强化学习
机器学习
2024-05-17 v3 人工智能
摘要
离线 Goal-Conditioned RL(GCRL)提供了一种从多样多任务离线数据集中学习通用策略的可行范式。尽管近期取得显著进展,主流离线 GCRL 方法主要为无模型方法,在处理有限数据及泛化至未见目标方面面临约束。本工作中,我们提出 Goal-conditioned Offline Planning(GOPlan),一种包含两关键阶段的基于模型新框架:(1)预训练能在多目标数据集中捕捉多模态动作分布的先验策略;(2)采用带规划的再分析方法生成想象轨迹以微调策略。具体而言,我们将先验策略建立在优势加权条件生成对抗网络之上,促进不同模式分离,缓解分布外(OOD)动作陷阱。为进一步策略优化,再分析方法通过对轨迹内与轨迹间目标用学习模型规划生成高质量虚构数据。通过充分实验评估,我们证明 GOPlan 在各种离线多目标导航与操控任务上达到 state-of-the-art 性能。此外,结果凸显 GOPlan 处理小数据量及泛化至 OOD 目标的优越能力。
引用
@article{arxiv.2310.20025,
title = {GOPlan: Goal-conditioned Offline Reinforcement Learning by Planning with Learned Models},
author = {Mianchu Wang and Rui Yang and Xi Chen and Hao Sun and Meng Fang and Giovanni Montana},
journal= {arXiv preprint arXiv:2310.20025},
year = {2024}
}
备注
Spotlight Presentation at Goal-conditioned Reinforcement Learning Workshop at NeurIPS 2023