中文

JueWu-MC:以样本高效的分层强化学习玩 Minecraft

机器学习 2021-12-10 v1 人工智能

摘要

在像 Minecraft 这样的开放世界游戏中学习理性行为,由于部分可观测性、高维视觉感知和延迟奖励的复合挑战,对强化学习(RL)研究而言仍然困难。为此,我们提出 JueWu-MC,一种配备表示学习与模仿学习以应对感知与探索的样本高效分层 RL 方法。具体而言,我们的方法包含两层层级结构,其中高层控制器学习控制选项的策略,低层工作器学习解决各子任务。为提升子任务学习,我们提出以下技术组合:1)捕获动作与表示间潜在关系的动作感知表示学习,2)基于判别器的自模仿学习以实现高效探索,3)带一致性过滤的集成行为克隆以增强策略鲁棒性。大量实验表明,JueWu-MC 显著提升了样本效率,并以大幅优势超越一组基线。值得注意的是,我们赢得了 NeurIPS MineRL 2021 研究竞赛冠军,并取得了史上最高性能分数。

关键词

引用

@article{arxiv.2112.04907,
  title  = {JueWu-MC: Playing Minecraft with Sample-efficient Hierarchical Reinforcement Learning},
  author = {Zichuan Lin and Junyou Li and Jianing Shi and Deheng Ye and Qiang Fu and Wei Yang},
  journal= {arXiv preprint arXiv:2112.04907},
  year   = {2021}
}

备注

The champion solution of NeurIPS 2021 MineRL research competition ( https://www.aicrowd.com/challenges/neurips-2021-minerl-diamond-competition/leaderboards )