双重对偶:用于约束强化学习的变分原始 - 对偶策略优化
机器学习
2024-02-19 v1 最优化与控制
机器学习
摘要
我们研究约束凸马尔可夫决策过程 (MDP),其目标是在满足凸约束的前提下最小化访问测度的凸泛函。为约束凸 MDP 设计算法面临若干挑战,包括 (1) 处理大规模状态空间,(2) 管理探索/利用权衡,以及 (3) 求解目标和约束均为访问测度非线性函数的约束优化问题。在本工作中,我们提出了一种基于模型的算法——变分原始 - 对偶策略优化 (VPDPO),其中实施了拉格朗日对偶和 Fenchel 对偶,将原始约束问题重构为无约束的原始 - 对偶优化。此外,原始变量遵循“不确定性下的乐观主义”(OFU) 原则,通过基于模型的值迭代进行更新,而对偶变量则通过梯度上升进行更新。而且,通过将访问测度嵌入到有限维空间中,我们可以结合函数逼近来处理大规模状态空间。两个显著的例子是 (1) 核化非线性调节器和 (2) 低秩 MDP。我们证明,在拥有乐观规划预言机的情况下,我们的算法在这两种情况下均能实现次线性遗憾和约束违反,并能达到原始约束问题的全局最优策略。
引用
@article{arxiv.2402.10810,
title = {Double Duality: Variational Primal-Dual Policy Optimization for Constrained Reinforcement Learning},
author = {Zihao Li and Boyi Liu and Zhuoran Yang and Zhaoran Wang and Mengdi Wang},
journal= {arXiv preprint arXiv:2402.10810},
year = {2024}
}