中文

强化学习泛化中的最优性不变原理

机器学习 2019-06-04 v1 人工智能 机器学习

摘要

最近的几篇论文通过提出新环境或向已有环境添加噪声的方式,然后在那些环境上对标算法和模型架构,考察了强化学习(RL)中的泛化。我们讨论了 RL 基准中一些在监督学习(SL)中不需要的微妙概念性质,以及 RL 基准应具备的性质。其中首要的是我们称之为最优性不变原理的一条:应存在一个在所有训练与测试任务上均最优的单一 π\pi。在本文中,我们论证该原理为何重要,以及由于状态表示或模型架构的微妙选择它如何被打破或满足。最后我们讨论在理论上分析泛化基准所面临的挑战与未来研究方向。

关键词

引用

@article{arxiv.1906.00336,
  title  = {The Principle of Unchanged Optimality in Reinforcement Learning Generalization},
  author = {Alex Irpan and Xingyou Song},
  journal= {arXiv preprint arXiv:1906.00336},
  year   = {2019}
}

备注

Published at ICML 2019 Workshop "Understanding and Improving Generalization in Deep Learning"