中文

面向终身强化学习的无模型生成回放:在星际争霸2中的应用

机器学习 2022-08-17 v2 人工智能

摘要

应对深度终身强化学习(LRL)挑战的一种方法是谨慎管理智能体的学习经验,以学习(且不遗忘)并构建内部元模型(关于任务、环境、智能体和世界)。生成回放(GR)是一种受生物学启发的回放机制,它利用随时间更新的内部生成模型抽取的自标注样本来增强学习经验。我们提出了一种满足两个需求的 LRL 用 GR 版本:(a)对使用深度 RL 学习的策略的潜表示进行内省式密度建模,以及(b)无模型端到端学习。本文中,我们研究了三种用于无模型 GR 的深度学习架构,从朴素的 GR 出发并添加成分以实现(a)和(b)。我们在包含来自 Starcraft-2 和 Minigrid 领域的任务的三类不同场景上评估了所提算法。我们报告了若干关键发现,展示了设计选择对包括迁移学习、对未见任务的泛化、任务变更后的快速适应、相对于任务专家的性能以及灾难性遗忘在内的量化指标的影响。我们观察到我们的 GR 防止了深度 RL 智能体潜向量空间中特征到动作映射的漂移。我们也展示了在既定终身学习目标指标上的改进。我们发现一个小的随机回放缓冲显著增加了训练的稳定性。总体而言,我们发现“隐藏回放”(一种用于类增量分类的知名架构)是最有前景的方法,推动了 LRL 中 GR 的技术水平(SOTA),并观察到睡眠模型的架构可能比所用回放类型对提升性能更为重要。我们的实验仅需要 6% 的训练样本即可在大多数 Starcraft-2 场景中达到专家性能的 80-90%。

关键词

引用

@article{arxiv.2208.05056,
  title  = {Model-Free Generative Replay for Lifelong Reinforcement Learning: Application to Starcraft-2},
  author = {Zachary Daniels and Aswin Raghavan and Jesse Hostetler and Abrar Rahman and Indranil Sur and Michael Piacentino and Ajay Divakaran},
  journal= {arXiv preprint arXiv:2208.05056},
  year   = {2022}
}

备注

Accepted to the First Conference on Lifelong Learning Agents (CoLLAs 2022)