中文

基于弯曲形式的鲁棒约束马尔可夫决策过程中的近最优策略识别

机器学习 2025-02-27 v2 神经与进化计算

摘要

在不确定环境中设计安全策略对于现实控制系统至关重要。然而,这一挑战在马尔可夫决策过程 (MDP) 框架中仍未得到充分解决。本文提出了首个能够保证识别鲁棒约束马尔可夫决策过程 (RCMDP) 中近最优策略的算法,其中最优策略是在一组环境中的最坏情况下下的累积成本最小化且满足约束。我们首先证明,常规的拉格朗日 max-min 公式的策略梯度方法可能陷入亚最优解。这发生在其内部最小化遇到目标函数和约束函数梯度之和的冲突时。为此,我们利用 RCMDP 问题的弯曲形式,该形式通过从目标或约束中选择单个梯度来解决冲突。基于弯曲形式,我们提出了带有策略梯度子程序的二分搜索算法,并证明其在 RCMDP 中以 O~(ε4)\tilde{\mathcal{O}}(\varepsilon^{-4}) 的鲁棒策略评估次数内识别出 ε\varepsilon 最优策略。

关键词

引用

@article{arxiv.2408.16285,
  title  = {ART: Actually Robust Training},
  author = {Sebastian Chwilczyński and Kacper Trębacz and Karol Cyganik and Mateusz Małecki and Dariusz Brzezinski},
  journal= {arXiv preprint arXiv:2408.16285},
  year   = {2025}
}