中文

通过频率正则化求解非矩形奖励鲁棒 MDP

机器学习 2024-02-13 v2

摘要

在鲁棒马尔可夫决策过程(RMDPs)中,假设奖励与转移动态位于给定的不确定性集合内。通过针对该集合中最具对抗性的模型获取最大回报,RMDPs 解决了性能对错误指定环境的敏感性问题。然而,为保持计算可处理性,不确定性集合传统上针对每个状态独立构造。这一所谓的矩形条件仅出于计算考量。因此,它缺乏实际激励,并可能导致过度保守的行为。本工作中,我们研究耦合奖励 RMDPs,其中转移核固定,但奖励函数位于距名义奖励的 α\alpha 半径之内。我们建立了此类非矩形奖励 RMDPs 与应用策略访问频率正则化之间的直接联系。我们引入一种策略梯度方法并证明其收敛性。数值实验表明,与矩形不确定性相比,所学策略的鲁棒性及其保守性更低的行为。

关键词

引用

@article{arxiv.2309.01107,
  title  = {Solving Non-Rectangular Reward-Robust MDPs via Frequency Regularization},
  author = {Uri Gadot and Esther Derman and Navdeep Kumar and Maxence Mohamed Elfatihi and Kfir Levy and Shie Mannor},
  journal= {arXiv preprint arXiv:2309.01107},
  year   = {2024}
}

备注

accepted in AAAI2024