基于句子级语义的文本冒险游戏零样本学习
计算与语言
2020-04-08 v1
摘要
诸如 Q-learning 的强化学习算法在训练模型学习给定系统状态下最优动作方面展现出巨大前景;这一目标在具有探索或对抗性质的应用(如任务导向对话或游戏)中尤为突出。然而,无法直接访问其状态的模型更难训练;当唯一的状态访问经由语言媒介时,这一点可能尤为明显。我们引入一种适用于深度 Q-learning 的新模型,其结合了连体神经网络架构与 Q 值函数的新颖重构,以更好地在经由语言通道的近似下表示系统状态。我们在零样本基于文本的冒险游戏学习背景下评估该模型。从外部看,我们的模型仅需基线 15% 的迭代次数即达到基线的收敛性能点,达到比基线高 15% 的收敛性能点,并能在无微调情况下游玩未见过的无关游戏。我们探查新模型的表示空间以确定:从内部看,这归因于将不同语言中介适当地聚类到同一状态中。
引用
@article{arxiv.2004.02986,
title = {Zero-Shot Learning of Text Adventure Games with Sentence-Level Semantics},
author = {Xusen Yin and Jonathan May},
journal= {arXiv preprint arXiv:2004.02986},
year = {2020}
}