中文

OpenAI Five 中的长期规划与态势感知

计算与语言 2019-12-17 v1 机器学习

摘要

鉴于无模型深度强化学习方法在高维观测与动作空间中学习过程的黑箱性质,理解关于世界的知识如何在其内部表示是一大挑战。AlphaStar 与 OpenAI Five 已表明,无需任何显式分层宏动作,智能体即可被训练至在需执行数千步动作方能达成最终目标的游戏中达到超人技能。鉴于这些模型缺乏分层或宏动作的显式表示,加之内部表示不可理解,评估智能体的计划与游戏理解变得困难。本文研究 OpenAI Five 学到的分布式表示,以探究游戏知识如何在训练过程中逐步获取。我们还引入一种通用技术,从智能体隐藏状态学习模型,以识别计划与子目标的形成。我们表明,智能体可跨动作学习态势相似性,并发现其在子目标执行前数分钟即存在朝向完成子目标的规划证据。我们对 2019 年 4 月对阵 DotA 2 世界冠军 OG 的比赛中的这些预测进行了定性分析。

关键词

引用

@article{arxiv.1912.06721,
  title  = {Long-Term Planning and Situational Awareness in OpenAI Five},
  author = {Jonathan Raiman and Susan Zhang and Filip Wolski},
  journal= {arXiv preprint arXiv:1912.06721},
  year   = {2019}
}