中文

面向零样本组合强化学习的环境生成

机器学习 2022-01-25 v1 人工智能

摘要

许多现实世界问题是组合性的——解决它们需要完成相互依赖的子任务,这些子任务以串行或并行方式组织,可表示为依赖图。深度强化学习(RL)智能体常因长时序与稀疏奖励而难以学习此类复杂任务。为解决该问题,我们提出环境组合设计(CoDE),其训练一个生成器智能体自动构建一系列适配 RL 智能体当前技能水平的组合任务。该自动课程不仅使智能体能学习比原本更复杂的任务,还选取智能体表现薄弱的任务,增强其鲁棒性及在测试时零样本泛化至未见任务的能力。我们分析了当前环境生成技术为何不足以生成组合任务,并提出解决这些问题的新算法。我们的结果在多个组合任务上评估了学习与泛化,包括学习导航并与网页交互这一现实问题。我们学习生成由多页面或多房间构成的环境,并训练能在该环境中完成广泛复杂任务的 RL 智能体。我们贡献了两个用于生成组合任务的新基准框架:组合 MiniGrid 与用于网页导航的 gMiniWoB。CoDE 比最强基线取得高 4 倍的成功率,并展现出在 3500 个基本任务上学习真实网站的强劲性能。

关键词

引用

@article{arxiv.2201.08896,
  title  = {Environment Generation for Zero-Shot Compositional Reinforcement Learning},
  author = {Izzeddin Gur and Natasha Jaques and Yingjie Miao and Jongwook Choi and Manoj Tiwari and Honglak Lee and Aleksandra Faust},
  journal= {arXiv preprint arXiv:2201.08896},
  year   = {2022}
}

备注

Published in NeurIPS 2021