中文

面向离线强化学习的温和约束评估策略

机器学习 2024-06-18 v2

摘要

离线强化学习(RL)方法对策略施加约束以紧密遵循行为策略,从而稳定价值学习并缓解测试时选择分布外(OOD)动作的问题。常规方法对价值学习和测试时推理施加相同的约束。然而,我们的发现表明,适用于价值估计的约束实际上对于测试时的动作选择可能过于严格。为解决该问题,我们提出一种用于测试时推理的\textit{温和约束评估策略(MCEP)},并以更具约束的\textit{目标策略}用于价值估计。由于\textit{目标策略}已被多种先前方法采用,MCEP 可作为插件与其无缝集成。我们基于 TD3BC(Fujimoto & Gu, 2021)、AWAC(Nair et al., 2020)和 DQL(Wang et al., 2023)算法实例化了 MCEP。在 D4RL MuJoCo 运动、高维人形以及一组 16 个机器人操作任务上的实证结果表明,MCEP 在经典离线 RL 方法上带来了显著性能提升,并能够进一步改进 SOTA 方法。代码开源于 \url{https://github.com/egg-west/MCEP.git}。

关键词

引用

@article{arxiv.2306.03680,
  title  = {Mildly Constrained Evaluation Policy for Offline Reinforcement Learning},
  author = {Linjie Xu and Zhengyao Jiang and Jinyu Wang and Lei Song and Jiang Bian},
  journal= {arXiv preprint arXiv:2306.03680},
  year   = {2024}
}