基于上下文相关观测剪枝的自举Q学习在文本游戏中实现泛化
机器学习
2020-09-28 v1 计算与语言
机器学习
摘要
我们表明,用于求解基于文本的游戏(TBGs)的强化学习(RL)方法通常无法在未见过的游戏上泛化,尤其是在小数据情形下。为解决此问题,我们提出了上下文相关片段状态截断(CREST),用于在观测文本中移除无关词元以改善泛化。我们的方法首先使用Q学习训练一个基础模型,该模型通常会过拟合训练游戏。基础模型的动作词元分布用于执行观测剪枝,移除无关词元。随后,第二个自举模型在剪枝后的观测文本上重新训练。我们的自举智能体在求解未见过的TextWorld游戏时表现出改进的泛化能力,与先前最先进的方法相比使用了少10倍至20倍的训练游戏,尽管所需的训练回合更少。
引用
@article{arxiv.2009.11896,
title = {Bootstrapped Q-learning with Context Relevant Observation Pruning to Generalize in Text-based Games},
author = {Subhajit Chaudhury and Daiki Kimura and Kartik Talamadupula and Michiaki Tatsubori and Asim Munawar and Ryuki Tachibana},
journal= {arXiv preprint arXiv:2009.11896},
year = {2020}
}
备注
Accepted to EMNLP 2020