离线强化学习的超立方策略正则化框架
机器学习
2026-02-12 v2
摘要
离线强化学习因其通过静态数据集学习策略而无需与环境交互,受到学者们的广泛关注。然而,通用的强化学习方法由于数据集在训练期间无法覆盖的超出分布状态动作,难以在离线强化学习中获得满意的结果。为解决这一问题,试图直接复制静态数据集中策略的策略正则化方法因其简单有效而受到大量关注。然而,策略约束方法会使智能体选择静态数据集中的对应动作。这种约束通常过于保守,导致次优策略,尤其是在质量较低的静态数据集中。本文提出了超立方体策略正则化框架,该方法通过允许智能体探索静态数据集中对应相似状态的动作,缓解了策略约束方法的约束,从而提高了算法在低质量数据集中的效果。我们还理论地证明了超立方体策略正则化框架能够有效提高原始算法的性能。此外,我们将超立方体策略正则化框架与 TD3-BC 和 Diffusion-QL 结合,在称为 TD3-BC-C 和 Diffusion-QL-C 的 D4RL 数据集上进行实验。实验结果表明,在大多数 D4RL 环境中,TD3-BC-C 和 Diffusion-QL-C 的得分优于像 IQL、CQL、TD3-BC 和 Diffusion-QL 等最先进的算法。
引用
@article{arxiv.2411.04534,
title = {Hypercube Policy Regularization Framework for Offline Reinforcement Learning},
author = {Yi Shen and Hanyan Huang},
journal= {arXiv preprint arXiv:2411.04534},
year = {2026}
}
备注
Revised version accepted at MLMI 2025