中文

深度强化学习中零样本泛化研究综述

机器学习 2023-01-20 v6 人工智能

摘要

深度强化学习(RL)中零样本泛化(ZSG)的研究旨在产生在部署时对新奇未知情境泛化良好、避免过拟合训练环境的 RL 算法。若要在多样化、动态且不可预测的真实世界场景中部署强化学习算法,解决此问题至关重要。本综述对该新兴领域进行概览。我们依托统一的形式化与术语来讨论不同的 ZSG 问题,建立在以往工作之上。进而我们对现有 ZSG 基准以及应对这些问题的当前方法进行分类。最后,我们对该领域的现状进行批判性讨论,包括对未来工作的建议。除其他结论外,我们认为单纯采用程序化内容生成方法进行基准设计不利于 ZSG 进展,建议将快速在线适应与解决 RL 特有问题作为 ZSG 方法未来工作的若干方向,并推荐在离线 RL ZSG 与奖励函数变化等未被充分探索的问题设定中构建基准。

关键词

引用

@article{arxiv.2111.09794,
  title  = {A Survey of Zero-shot Generalisation in Deep Reinforcement Learning},
  author = {Robert Kirk and Amy Zhang and Edward Grefenstette and Tim Rocktäschel},
  journal= {arXiv preprint arXiv:2111.09794},
  year   = {2023}
}

备注

JAIR version. Added formal definitions of ZSPT and related concepts, JAIR formatting, other small rewrites; https://www.jair.org/index.php/jair/article/view/14174