基于能量模型的奖励条件强化学习的贝叶斯重参数化
机器学习
2023-05-22 v1 机器人学
摘要
近来,奖励条件强化学习(RCRL)因其简单性、灵活性与离策略特性而受到关注。然而,我们将表明当前的 RCRL 方法存在根本局限,未能解决 RCRL 的两个关键挑战——提升高奖励到走(RTG)输入的泛化能力,以及避免测试时的分布外(OOD)RTG 查询。为在训练原始 RCRL 架构时应对这些挑战,我们提出 Bayesian Reparameterized RCRL(BR-RCRL,贝叶斯重参数化 RCRL),一组受贝叶斯定理启发的 RCRL 新型归纳偏置。BR-RCRL 消除了阻碍原始 RCRL 在高 RTG 输入上泛化的核心障碍——模型将不同 RTG 输入视为独立值的倾向,我们称之为“RTG 独立性”。BR-RCRL 还使我们能设计一种配套的自适应推断方法,在最大化总回报的同时避免产生原始 RCRL 方法中不可预测行为的 OOD 查询。我们表明 BR-RCRL 在 Gym-Mujoco 与 Atari 离线 RL 基准上取得了最先进的性能,相较原始 RCRL 提升达 11%。
引用
@article{arxiv.2305.11340,
title = {Bayesian Reparameterization of Reward-Conditioned Reinforcement Learning with Energy-based Models},
author = {Wenhao Ding and Tong Che and Ding Zhao and Marco Pavone},
journal= {arXiv preprint arXiv:2305.11340},
year = {2023}
}
备注
Accepted to ICML 2023