中文

策略改进的几何

人工智能 2017-04-07 v1 最优化与控制

摘要

我们研究了最优无记忆时间无关决策的几何与执行 agent 掌握的系统状态信息量之间的关系。我们表明,只要至多有 kk 个世界状态与 agent 的观测相一致,期望长期回报(无论是折扣回报还是每步回报)均可由在至多 kk 个动作间进行随机化的策略最大化。此外,我们表明每步期望回报可以基于期望折扣回报进行研究。我们的主要工具是策略改进引理的几何版本,它确定了一个策略变化的凸多面体锥,在该锥中所有状态的状态值函数均增加。

关键词

引用

@article{arxiv.1704.01785,
  title  = {Geometry of Policy Improvement},
  author = {Guido Montufar and Johannes Rauh},
  journal= {arXiv preprint arXiv:1704.01785},
  year   = {2017}
}

备注

8 pages