强化学习泛化中的最优性不变原理
机器学习
2019-06-04 v1 人工智能
机器学习
摘要
最近的几篇论文通过提出新环境或向已有环境添加噪声的方式,然后在那些环境上对标算法和模型架构,考察了强化学习(RL)中的泛化。我们讨论了 RL 基准中一些在监督学习(SL)中不需要的微妙概念性质,以及 RL 基准应具备的性质。其中首要的是我们称之为最优性不变原理的一条:应存在一个在所有训练与测试任务上均最优的单一 。在本文中,我们论证该原理为何重要,以及由于状态表示或模型架构的微妙选择它如何被打破或满足。最后我们讨论在理论上分析泛化基准所面临的挑战与未来研究方向。
引用
@article{arxiv.1906.00336,
title = {The Principle of Unchanged Optimality in Reinforcement Learning Generalization},
author = {Alex Irpan and Xingyou Song},
journal= {arXiv preprint arXiv:1906.00336},
year = {2019}
}
备注
Published at ICML 2019 Workshop "Understanding and Improving Generalization in Deep Learning"