中文

面向鲁棒约束马尔可夫决策过程的鲁棒拉格朗日与对抗策略梯度

机器学习 2024-05-16 v3 人工智能 神经与进化计算

摘要

鲁棒约束马尔可夫决策过程(RCMDP)是近期一种用于强化学习的任务建模框架,它引入了行为约束,并通过使用不确定性集对转移动态模型中的误差提供鲁棒性。模拟RCMDP需要基于每个状态的价值估计计算最坏情况动态,该方法此前已用于鲁棒约束策略梯度(RCPG)。针对RCPG的潜在缺陷(如未对完整约束目标进行鲁棒化以及缺乏增量学习),本文提出两种算法,称为带鲁棒拉格朗日的RCPG(RCPG with Robust Lagrangian)与对抗式RCPG(Adversarial RCPG)。带鲁棒拉格朗日的RCPG通过基于拉格朗日量而非价值或约束来取最坏情况动态对RCPG进行修改。对抗式RCPG同样基于拉格朗日量构造最坏情况动态,但将其作为对抗策略通过梯度下降直接且增量式地学习,而非通过对排序价值列表的约束优化间接且突兀地获得。理论分析首先推导了两种算法策略优化的拉格朗日策略梯度,随后推导了对抗式RCPG中学习对抗者的对抗策略梯度。在库存管理与安全导航任务中注入扰动的实证实验表明,两种算法相较于传统RCPG变体以及非鲁棒、非约束的消融版本均具有竞争性表现。特别地,对抗式RCPG在所有测试中均位列性能最优的前两种算法之一。

关键词

引用

@article{arxiv.2308.11267,
  title  = {Robust Lagrangian and Adversarial Policy Gradient for Robust Constrained Markov Decision Processes},
  author = {David M. Bossens},
  journal= {arXiv preprint arXiv:2308.11267},
  year   = {2024}
}