如何避免被Grue吃掉:文本冒险智能体的探索策略
机器学习
2020-02-21 v1 人工智能
计算与语言
摘要
基于文本的游戏——智能体通过文本自然语言与世界交互——向我们提出了组合规模动作空间的问题。当前大多数强化学习算法无法有效处理每回合如此大量的可能动作。由此导致的低样本效率,使得智能体无法通过瓶颈状态,即它们因未见正确动作序列以足够次数通过瓶颈而获得充分强化,从而无法继续。在先前将知识图谱用于强化学习的工作基础上,我们引入了两种新的游戏状态探索策略。我们在经典文本冒险游戏Zork1上将我们的探索策略与强基线进行比较,此前的智能体一直无法通过被Grue吃掉的瓶颈状态。
引用
@article{arxiv.2002.08795,
title = {How To Avoid Being Eaten By a Grue: Exploration Strategies for Text-Adventure Agents},
author = {Prithviraj Ammanabrolu and Ethan Tien and Zhaochen Luo and Mark O. Riedl},
journal= {arXiv preprint arXiv:2002.08795},
year = {2020}
}