中文

强化学习中的观测过拟合

机器学习 2020-01-01 v2 人工智能 机器学习

摘要

无模型强化学习(RL)中过拟合的一个主要情形是:智能体可能错误地将奖励与由马尔可夫决策过程(MDP)生成的观测中的某些伪特征相关联。我们提供了一个分析此场景的通用框架,并借此仅通过修改 MDP 的观测空间设计了多个合成基准。当智能体即使底层 MDP 动力学固定,仍对不同观测空间过拟合时,我们称之为观测过拟合。我们的实验揭示了引人入胜的特性,尤其关于隐式正则化,并且也证实了先前 RL 泛化与监督学习(SL)工作中的结果。

关键词

引用

@article{arxiv.1912.02975,
  title  = {Observational Overfitting in Reinforcement Learning},
  author = {Xingyou Song and Yiding Jiang and Stephen Tu and Yilun Du and Behnam Neyshabur},
  journal= {arXiv preprint arXiv:1912.02975},
  year   = {2020}
}

备注

Published as a conference paper in ICLR 2020