策略改进的几何
人工智能
2017-04-07 v1 最优化与控制
摘要
我们研究了最优无记忆时间无关决策的几何与执行 agent 掌握的系统状态信息量之间的关系。我们表明,只要至多有 个世界状态与 agent 的观测相一致,期望长期回报(无论是折扣回报还是每步回报)均可由在至多 个动作间进行随机化的策略最大化。此外,我们表明每步期望回报可以基于期望折扣回报进行研究。我们的主要工具是策略改进引理的几何版本,它确定了一个策略变化的凸多面体锥,在该锥中所有状态的状态值函数均增加。
引用
@article{arxiv.1704.01785,
title = {Geometry of Policy Improvement},
author = {Guido Montufar and Johannes Rauh},
journal= {arXiv preprint arXiv:1704.01785},
year = {2017}
}
备注
8 pages