中文

基于惊喜最小化的强化学习泛化

机器学习 2020-07-06 v2 人工智能

摘要

泛化仍是深度强化学习算法的挑战性问题,这类算法常在相同的确定性博弈环境集合上训练与测试。当测试环境未见且受扰动但任务本质不变时,便会产生泛化鸿沟。在本工作中,我们在一个泛化基准上提出并评估了一个惊喜最小化智能体,以表明从一个简单密度模型学到的额外奖励,能在提供持续熵与随机性来源的程序生成博弈环境中展现出鲁棒性。

关键词

引用

@article{arxiv.2004.12399,
  title  = {Reinforcement Learning Generalization with Surprise Minimization},
  author = {Jerry Zikun Chen},
  journal= {arXiv preprint arXiv:2004.12399},
  year   = {2020}
}

备注

Inductive biases, invariances and generalization in RL Workshop, ICML 2020