强化学习中的观测过拟合
机器学习
2020-01-01 v2 人工智能
机器学习
摘要
无模型强化学习(RL)中过拟合的一个主要情形是:智能体可能错误地将奖励与由马尔可夫决策过程(MDP)生成的观测中的某些伪特征相关联。我们提供了一个分析此场景的通用框架,并借此仅通过修改 MDP 的观测空间设计了多个合成基准。当智能体即使底层 MDP 动力学固定,仍对不同观测空间过拟合时,我们称之为观测过拟合。我们的实验揭示了引人入胜的特性,尤其关于隐式正则化,并且也证实了先前 RL 泛化与监督学习(SL)工作中的结果。
引用
@article{arxiv.1912.02975,
title = {Observational Overfitting in Reinforcement Learning},
author = {Xingyou Song and Yiding Jiang and Stephen Tu and Yilun Du and Behnam Neyshabur},
journal= {arXiv preprint arXiv:1912.02975},
year = {2020}
}
备注
Published as a conference paper in ICLR 2020