中文

DiffCPS:基于扩散模型的离线强化学习约束策略搜索

机器学习 2024-02-29 v2

摘要

约束策略搜索(CPS)是离线强化学习中的基本问题,通常通过优势加权回归(AWR)求解。然而,由于基于高斯策略的表达能力有限,先前方法仍可能遭遇分布外动作。另一方面,由于 AWR 需要精确的策略概率密度(在扩散模型中难以处理),直接将具有分布表达能力的先进模型(即扩散模型)应用于 AWR 框架是不可行的。本文提出一种新方法,基于扩散的约束策略搜索\textbf{基于扩散的约束策略搜索}(称为 DiffCPS),其用对偶原对偶方法处理基于扩散的约束策略搜索。理论分析表明,基于扩散的 CPS 问题满足强对偶性,且在引入参数近似后,经过 O(1/ϵ)\mathcal{O}(1/\epsilon) 次对偶迭代可获得近似解,其中 ϵ\epsilon 表示参数化策略的表示能力。基于 D4RL 基准的大量实验结果证明了我们方法的有效性。我们经验性地表明,与传统基于 AWR 的基线以及近期基于扩散的离线 RL 方法相比,DiffCPS 取得了更好或至少具竞争力的性能。代码现已发布于 https://github.com/felix-thu/DiffCPS。

关键词

引用

@article{arxiv.2310.05333,
  title  = {DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning},
  author = {Longxiang He and Li Shen and Linrui Zhang and Junbo Tan and Xueqian Wang},
  journal= {arXiv preprint arXiv:2310.05333},
  year   = {2024}
}

备注

22 pages, 9 figures, 6 tables. Submitted to ICML 2024. arXiv admin note: text overlap with arXiv:1910.13393 by other authors