基于惊喜最小化的强化学习泛化
机器学习
2020-07-06 v2 人工智能
摘要
泛化仍是深度强化学习算法的挑战性问题,这类算法常在相同的确定性博弈环境集合上训练与测试。当测试环境未见且受扰动但任务本质不变时,便会产生泛化鸿沟。在本工作中,我们在一个泛化基准上提出并评估了一个惊喜最小化智能体,以表明从一个简单密度模型学到的额外奖励,能在提供持续熵与随机性来源的程序生成博弈环境中展现出鲁棒性。
引用
@article{arxiv.2004.12399,
title = {Reinforcement Learning Generalization with Surprise Minimization},
author = {Jerry Zikun Chen},
journal= {arXiv preprint arXiv:2004.12399},
year = {2020}
}
备注
Inductive biases, invariances and generalization in RL Workshop, ICML 2020