组合保守主义:离线强化学习中的直推方法
机器学习
2024-04-09 v1 人工智能
机器人学
摘要
离线强化学习(RL)是一个极具吸引力的框架,旨在无需与环境额外交互的情况下从过往经验中学习最优策略。然而,离线 RL 不可避免地面临分布偏移问题,即在策略执行期间遇到的状态和动作可能不在训练数据集分布中。一种常见的解决方案是将保守主义引入策略或价值函数,以防范不确定性与未知因素。在本工作中,我们致力于实现相同的保守主义目标,但采用不同的视角。我们提出了用于离线 RL 的带锚点搜索的组合保守主义(COCOA),该方法在直推重参数化(Netanyahu et al., 2023)的基础上以组合方式追求保守主义,将输入变量(在我们的场景中为状态)分解为锚点及其与原始输入的差异。我们的 COCOA 利用学习到的逆向动力学模型同时寻找分布内锚点与差异,促使策略或价值函数在组合输入空间中保持保守性。这种组合保守主义与离线 RL 中普遍存在的行为保守主义相互独立且互不知晓。我们将 COCOA 应用于四种最先进的离线 RL 算法,并在 D4RL 基准上进行评估,结果表明 COCOA 通常能提升每种算法的性能。代码可在 https://github.com/runamu/compositional-conservatism 获取。
引用
@article{arxiv.2404.04682,
title = {Compositional Conservatism: A Transductive Approach in Offline Reinforcement Learning},
author = {Yeda Song and Dongwook Lee and Gunhee Kim},
journal= {arXiv preprint arXiv:2404.04682},
year = {2024}
}
备注
ICLR 2024