中文

约束生成策略优化 (CGPO):混合离散-连续马尔可夫决策过程中策略优化的非线性规划方法

最优化与控制 2025-03-18 v2 机器学习 机器人学 符号计算 系统与控制 系统与控制

摘要

我们提出了约束生成策略优化 (CGPO) 框架,用于在紧凑且可解释的策略类中优化混合离散-连续马尔可夫决策过程 (DC-MDP) 的策略参数。CGPO 不仅能为许多具有表达性非线性动力学的 DC-MDP 在无限初始状态范围内提供有界的策略误差保证,还能在终止时误差为零的情况下,可证明地推导出最优策略。此外,CGPO 可以生成最坏情况状态轨迹,以诊断策略缺陷并提供最优动作的反事实解释。为取得这些成果,CGPO 提出了一个双层混合整数非线性优化框架,用于在定义的表达性类别(例如分段线性)中优化策略,并将其简化为一种对抗性地生成最坏情况状态轨迹的最优约束生成方法。此外,利用现代非线性优化器,CGPO 可以获得具有有界最优性间隙保证的解。我们通过机会约束处理随机转移,提供高概率的性能保证。我们还提出了一个路线图,用于理解不同策略、奖励和转移动力学表达类的计算复杂性。我们通过实验证明了 CGPO 在库存控制、水库系统管理和物理控制等多个领域的适用性。总之,CGPO 提供了结构化、紧凑且可解释的策略,并具有有界性能保证,能够实现最坏情况场景生成和反事实策略诊断。

关键词

引用

@article{arxiv.2401.12243,
  title  = {Constraint-Generation Policy Optimization (CGPO): Nonlinear Programming for Policy Optimization in Mixed Discrete-Continuous MDPs},
  author = {Michael Gimelfarb and Ayal Taitler and Scott Sanner},
  journal= {arXiv preprint arXiv:2401.12243},
  year   = {2025}
}

备注

Published in 22nd International Conference on the Integration of Constraint Programming, Artificial Intelligence, and Operations Research