将自然语言指令锚定到星际争霸 II 游戏状态以实现叙述引导的强化学习
多媒体
2019-06-07 v1 计算与语言
机器学习
神经与进化计算
机器人学
摘要
尽管深度强化学习技术已使智能体能够成功学会许多先前无法学习的任务,这些技术仍易受长期存在的{\em 奖励稀疏}问题影响。对于训练智能体玩实时策略游戏星际争霸 II 这类任务尤为如此,其奖励仅在通常很长的游戏结束时给出。虽然可通过奖励塑形解决该问题,但此类方法通常需要具备专业知识的人类专家。受通过更易于使用的自然语言叙述范式实现奖励塑形的愿景启发,我们研究了在多大程度上可通过将这些叙述锚定到特定目标状态来使其情境化。我们提出了一种使用多输入深度神经网络的互嵌入模型,该模型将自然语言指令序列投影到与相应目标状态相同的高维表示空间。我们表明,使用该模型可学习到具有可分离且 distinct 簇的嵌入空间,从而将自然语言指令准确映射到相应游戏状态。我们还讨论了该模型如何使叙述作为一种鲁棒形式的奖励塑形得以使用,以提升强化学习的性能与效率。
引用
@article{arxiv.1906.02671,
title = {Grounding Natural Language Commands to StarCraft II Game States for Narration-Guided Reinforcement Learning},
author = {Nicholas Waytowich and Sean L. Barton and Vernon Lawhern and Ethan Stump and Garrett Warnell},
journal= {arXiv preprint arXiv:1906.02671},
year = {2019}
}
备注
10 pages, 3 figures. Published at SPIE 2019