中文

程序化内容生成:面向迁移强化学习的更优基准

机器学习 2022-01-13 v1

摘要

强化学习中的迁移(TRL)概念引人入胜:能够将知识从一个问题迁移到另一个问题,而无需从零开始学习一切。这有望实现更快的学习以及学习更复杂的方法。为了深入了解该领域并发现新兴趋势,我们进行了数据库检索。我们注意到深度学习出奇地晚才被采用,始于2018年。深度学习的引入尚未解决TRL的最大挑战:泛化。当不同领域具有强相似性(例如MountainCar到Cartpole)时,跨领域迁移效果良好,且大多数TRL论文聚焦于同一领域内差异较小的不同任务。我们遇到的大多数TRL应用将其改进与自定义基线进行比较,该领域仍缺乏统一基准。我们认为这是一种令人失望的状况。对于未来,我们注意到:(1) 需要一种明确的任务相似性度量。(2) 泛化能力需要提升。有前景的方法通过MCTS将深度学习与规划相结合,或通过LSTM引入记忆。(3) 缺乏基准工具的问题将得到补救,以实现有意义的比较和进展度量。Alchemy和Meta-World已经成为有趣的基准套件。我们注意到另一发展,即程序化内容生成(PCG)的增加,可改善TRL中的基准和泛化。

关键词

引用

@article{arxiv.2105.14780,
  title  = {Procedural Content Generation: Better Benchmarks for Transfer Reinforcement Learning},
  author = {Matthias Müller-Brockhausen and Mike Preuss and Aske Plaat},
  journal= {arXiv preprint arXiv:2105.14780},
  year   = {2022}
}