NetHack 难以攻破
机器学习
2023-10-31 v2 人工智能
摘要
神经策略学习方法已在各类控制问题中取得显著成果,从 Atari 游戏到模拟运动控制。然而,这些方法在长视野任务中表现不佳,尤其在具有多模态观测的开放式环境中,例如流行的地牢探索游戏 NetHack。有趣的是,NeurIPS 2021 NetHack 挑战赛显示,符号智能体在中位游戏分数上以超过四倍的优势超越神经方法。本文深入探讨这一性能差距背后的原因,并对 NetHack 上的神经策略学习展开广泛研究。为开展该研究,我们分析了获胜的符号智能体,扩展其代码库以追踪内部策略选择,从而生成了最大的可用演示数据集之一。利用该数据集,我们考察了(i)动作层次结构的优势;(ii)神经架构的改进;以及(iii)强化学习与模仿学习的结合。我们的研究产生了一个最先进的神经智能体,在离线设置与在线设置的中位游戏分数上分别超越以往全神经策略 127% 与 25%。然而,我们也证明仅依靠规模扩展不足以弥合与最佳符号模型乃至顶尖人类玩家之间的性能差距。
引用
@article{arxiv.2305.19240,
title = {NetHack is Hard to Hack},
author = {Ulyana Piterbarg and Lerrel Pinto and Rob Fergus},
journal= {arXiv preprint arXiv:2305.19240},
year = {2023}
}
备注
NeurIPS 2023