中文

强化学习中的值函数多面体

机器学习 2019-05-17 v3 人工智能 机器学习

摘要

我们建立了有限状态-动作马尔可夫决策过程中值函数空间的几何与拓扑性质。我们的主要贡献是刻画了其形状的本质:一个一般多面体(Aigner 等,2010)。为证明该结果,我们展示了策略与值函数之间结构关系的若干性质,包括线定理,该定理表明在除一个状态外均受约束的策略其值函数描述一条线段。最后,我们利用这一新颖视角引入可视化方法,以增进对强化学习算法动力学的理解。

关键词

引用

@article{arxiv.1901.11524,
  title  = {The Value Function Polytope in Reinforcement Learning},
  author = {Robert Dadashi and Adrien Ali Taïga and Nicolas Le Roux and Dale Schuurmans and Marc G. Bellemare},
  journal= {arXiv preprint arXiv:1901.11524},
  year   = {2019}
}