优先关卡回放
机器学习
2021-06-15 v4 人工智能
摘要
具有程序化生成内容的环境是测试深度强化学习中系统性泛化能力的重要基准。在这种设置下,每个关卡都是一个算法生成的环境实例,具有独特的变异因子配置。在预先指定的关卡子集上进行训练,可以测试对未见关卡的泛化能力。从关卡中可以学到什么取决于当前策略,然而先前的工作默认独立于策略对训练关卡进行均匀采样。我们引入了优先关卡回放(Prioritized Level Replay, PLR),这是一个通过优先选择在未来重新访问时具有更高估计学习潜力的关卡来选择性采样下一个训练关卡的通用框架。我们表明 TD 误差能有效估计关卡的未来学习潜力,并且当用于指导采样过程时,会引发一个难度逐渐递增的涌现式课程。通过调整训练关卡的采样,PLR 显著提高了 Procgen Benchmark 上的样本效率和泛化能力——在测试回报上匹配了先前的 SOTA——并且易于与其他方法结合。与先前领先的方法结合后,PLR 将 SOTA 提升至相对于标准 RL 基线测试回报超过 76% 的提升。
引用
@article{arxiv.2010.03934,
title = {Prioritized Level Replay},
author = {Minqi Jiang and Edward Grefenstette and Tim Rocktäschel},
journal= {arXiv preprint arXiv:2010.03934},
year = {2021}
}