中文

一种用于离线约束强化学习的原始-对偶-评论家算法

机器学习 2023-10-23 v2 机器学习

摘要

离线约束强化学习(RL)旨在利用已有数据集学习一个策略,在期望累积代价的约束下最大化期望累积奖励。本文提出原始-对偶-评论家算法(PDCA),一种用于具有一般函数逼近的离线约束 RL 的新算法。PDCA 在由评论家估计的拉格朗日函数上运行原始-对偶算法。原始参与者采用无遗憾策略优化预言机以最大化拉格朗日估计,对偶参与者贪心地行动以最小化拉格朗日估计。我们证明 PDCA 能成功找到拉格朗日函数的近鞍点,该点对约束 RL 问题近乎最优。与以往需要可集中性和强贝尔曼完备性假设的工作不同,PDCA 仅需要可集中性和可实现性假设即可实现样本高效学习。

关键词

引用

@article{arxiv.2306.07818,
  title  = {A Primal-Dual-Critic Algorithm for Offline Constrained Reinforcement Learning},
  author = {Kihyuk Hong and Yuhang Li and Ambuj Tewari},
  journal= {arXiv preprint arXiv:2306.07818},
  year   = {2023}
}