中文

无模型的鲁棒平均奖赏强化学习

机器学习 2023-05-19 v1 人工智能

摘要

鲁棒马尔可夫决策过程 (MDP) 通过在一组 MDP 的不确定性集合上优化最坏情况性能来应对模型不确定性挑战。本文关注无模型设定下的鲁棒平均奖赏 MDP。我们首先从理论刻画鲁棒平均奖赏 Bellman 方程解的结构,这对手后的收敛分析至关重要。随后我们设计两种无模型算法,鲁棒相对值迭代 (RVI) TD 与鲁棒 RVI Q-learning,并从理论证明它们收敛到最优解。我们给出若干广泛使用的不确定性集合作为示例,包括由污染模型、总变差、卡方散度、Kullback-Leibler (KL) 散度与 Wasserstein 距离所定义的集合。

关键词

引用

@article{arxiv.2305.10504,
  title  = {Model-Free Robust Average-Reward Reinforcement Learning},
  author = {Yue Wang and Alvaro Velasquez and George Atia and Ashley Prater-Bennette and Shaofeng Zou},
  journal= {arXiv preprint arXiv:2305.10504},
  year   = {2023}
}

备注

ICML 2023