用于离线约束强化学习的半梯度DICE
机器学习
2025-06-11 v1
摘要
平稳分布校正估计(DICE)解决了由策略诱导的平稳分布与可靠离策略评估(OPE)和策略优化所需目标分布之间的不匹配问题。基于DICE的离线约束强化学习特别受益于DICE的灵活性,因为它在离线设置中同时最大化回报并估计代价。然而,我们观察到近期旨在提升DICE框架离线强化学习性能的方法无意中削弱了其执行OPE的能力,使其不适用于约束强化学习场景。在本文中,我们识别了这一局限性的根本原因:它们依赖于半梯度优化,该方法解决的是一个本质上不同的优化问题,并导致代价估计的失败。基于这些洞察,我们提出了一种新方法,通过半梯度DICE实现OPE和约束强化学习。我们的方法确保了准确的代价估计,并在离线约束强化学习基准DSRL上取得了最先进的性能。
引用
@article{arxiv.2506.08644,
title = {Semi-gradient DICE for Offline Constrained Reinforcement Learning},
author = {Woosung Kim and JunHo Seo and Jongmin Lee and Byung-Jun Lee},
journal= {arXiv preprint arXiv:2506.08644},
year = {2025}
}
备注
Constrained Offline Reinforcement Learning