通过 Minecraft 中从演示学习实现样本高效强化学习
机器学习
2020-03-16 v1 机器学习
摘要
深度强化学习方法的样本低效是其在现实世界应用中使用的主要障碍。在这项工作中,我们展示了人类演示如何仅通过 8M 帧的环境交互就能提升智能体在 Minecraft 小游戏 ObtainDiamond 上的最终性能。我们提出了一种训练流程,其中策略网络首先在人类数据上训练,随后通过强化学习进行微调。利用策略利用机制、经验回放以及针对灾难性遗忘的附加损失,我们的最佳智能体取得了 48 的平均分数。我们提出的方案在 NeurIPS MineRL 样本高效强化学习竞赛中获得第 3 名。
引用
@article{arxiv.2003.06066,
title = {Sample Efficient Reinforcement Learning through Learning from Demonstrations in Minecraft},
author = {Christian Scheller and Yanick Schraner and Manfred Vogel},
journal= {arXiv preprint arXiv:2003.06066},
year = {2020}
}
备注
10 pages, 2 figures