如何避免被Grue吃掉:文本世界的结构化探索策略
人工智能
2020-06-16 v1 计算与语言
机器学习
机器学习
摘要
文本游戏是长谜题或任务,其特点是序列化的稀疏且可能具有欺骗性的奖励。它们为开发智能体提供了一个理想平台,这些智能体使用组合大小的自然语言状态-动作空间来感知世界并对其采取行动。标准的强化学习智能体在有效探索此类空间方面能力不足,并且常常难以克服瓶颈——即智能体无法通过的状态,仅仅因为它们没有足够多次看到正确的动作序列以获得足够的强化。我们引入了Q*BERT,一个通过回答问题来学习构建世界知识图的智能体,这带来了更高的样本效率。为了克服瓶颈,我们进一步引入了MC!Q*BERT,一个使用基于知识图的内在动机来检测瓶颈,并采用新颖的探索策略来高效学习一系列策略模块以克服瓶颈的智能体。我们进行了消融研究,并展示了我们的方法如何在九个文本游戏中超越当前最先进水平,包括流行游戏Zork,其中学习智能体首次通过了玩家被Grue吃掉的瓶颈。
引用
@article{arxiv.2006.07409,
title = {How to Avoid Being Eaten by a Grue: Structured Exploration Strategies for Textual Worlds},
author = {Prithviraj Ammanabrolu and Ethan Tien and Matthew Hausknecht and Mark O. Riedl},
journal= {arXiv preprint arXiv:2006.07409},
year = {2020}
}