面向离线强化学习的想象限制 Q 学习
机器学习
2025-05-20 v1 人工智能
摘要
离线强化学习旨在仅从历史数据中推导改进的策略,但通常在对超分布(OOD)动作进行乐观价值估计时会遇到困难。这一问题通常通过策略约束或保守价值正则化方法来缓解。然而,这些方法可能施加过度约束或偏置价值估计,从而限制性能提升。为了平衡利用和限制,我们提出了想象限制 Q 学习(ILQ)方法,旨在维持对 OOD 动作在适当限制内的乐观估计。具体而言,我们利用动态模型对 OOD 动作价值进行想象,然后将想象值裁剪为最大行为值。这种设计在尽可能远地保持对 OOD 动作的合理评估,同时避免其乐观偏差。理论上,我们证明了在表格马尔可夫决策过程下,提议的 ILQ 的收敛性。特别地,我们展示了 OOD 状态-动作的估计值与最优值的误差界具有与 in-distribution 相同的数量级,从而表明价值估计的偏差实际上被有效缓解。实验上,我们的方法在 D4RL 基准中的广泛任务上实现了最先进的性能。
引用
@article{arxiv.2505.12211,
title = {Imagination-Limited Q-Learning for Offline Reinforcement Learning},
author = {Wenhui Liu and Zhijian Wu and Jingchao Wang and Dingjiang Huang and Shuigeng Zhou},
journal= {arXiv preprint arXiv:2505.12211},
year = {2025}
}
备注
Accepted by IJCAI 2025