中文

鲁棒值函数的几何性质

机器学习 2022-08-12 v2

摘要

值函数空间是强化学习中的基本概念。刻画其几何性质或为优化与表示提供洞见。现有工作主要聚焦马尔可夫决策过程(MDP)的值空间。本文研究更一般的鲁棒MDP(RMDP,考虑转移不确定性)下鲁棒值空间的几何。具体而言,因我们发现难以直接将先前方法适配RMDP,先从重访非鲁棒情形出发,引入新视角使我们以相似方式刻画非鲁棒与鲁棒值空间。该视角关键是以状态方式将值空间分解为超曲面之并。经分析,我们表明鲁棒值空间由一组锥超曲面决定,每面包含于某一状态下一致的所有策略的鲁棒值。此外,我们发现仅取不确定性集中的极值点即足以决定鲁棒值空间。最后,我们讨论鲁棒值空间其他方面,包括其非凸性及多状态策略一致性。

关键词

引用

@article{arxiv.2201.12929,
  title  = {The Geometry of Robust Value Functions},
  author = {Kaixin Wang and Navdeep Kumar and Kuangqi Zhou and Bryan Hooi and Jiashi Feng and Shie Mannor},
  journal= {arXiv preprint arXiv:2201.12929},
  year   = {2022}
}