通过频率正则化求解非矩形奖励鲁棒 MDP
机器学习
2024-02-13 v2
摘要
在鲁棒马尔可夫决策过程(RMDPs)中,假设奖励与转移动态位于给定的不确定性集合内。通过针对该集合中最具对抗性的模型获取最大回报,RMDPs 解决了性能对错误指定环境的敏感性问题。然而,为保持计算可处理性,不确定性集合传统上针对每个状态独立构造。这一所谓的矩形条件仅出于计算考量。因此,它缺乏实际激励,并可能导致过度保守的行为。本工作中,我们研究耦合奖励 RMDPs,其中转移核固定,但奖励函数位于距名义奖励的 半径之内。我们建立了此类非矩形奖励 RMDPs 与应用策略访问频率正则化之间的直接联系。我们引入一种策略梯度方法并证明其收敛性。数值实验表明,与矩形不确定性相比,所学策略的鲁棒性及其保守性更低的行为。
引用
@article{arxiv.2309.01107,
title = {Solving Non-Rectangular Reward-Robust MDPs via Frequency Regularization},
author = {Uri Gadot and Esther Derman and Navdeep Kumar and Maxence Mohamed Elfatihi and Kfir Levy and Shie Mannor},
journal= {arXiv preprint arXiv:2309.01107},
year = {2024}
}
备注
accepted in AAAI2024