学习信任Bellman更新:离线强化学习的选择性状态自适应正则化
机器学习
2025-05-27 v1 机器学习
摘要
离线强化学习(RL)旨在从静态数据集中学习有效策略。为缓解外推误差,现有研究通常对所有状态均匀地正则化值函数或策略更新。然而,由于数据质量的显著差异,固定的正则化强度常导致两难困境:较弱的正则化强度无法解决外推误差和值过估计问题,而较强的正则化强度则使策略学习偏向行为克隆,阻碍了Bellman更新所赋予的潜在性能。为解决此问题,我们提出了一种用于离线RL的选择性状态自适应正则化方法。具体而言,我们引入状态自适应正则化系数以信任状态级Bellman驱动结果,同时选择性地对高质量动作施加正则化,旨在避免对低质量动作的严格约束所导致的性能下降。通过建立代表性值正则化方法CQL与显式策略约束方法之间的联系,我们有效地将选择性状态自适应正则化扩展到这两种主流离线RL方法中。大量实验表明,所提方法在D4RL基准的离线及离线转在线设置中均显著优于现有方法。
引用
@article{arxiv.2505.19923,
title = {Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL},
author = {Qin-Wen Luo and Ming-Kun Xie and Ye-Wen Wang and Sheng-Jun Huang},
journal= {arXiv preprint arXiv:2505.19923},
year = {2025}
}
备注
Accepted to ICML 2025