中文

基于上下文相关观测剪枝的自举Q学习在文本游戏中实现泛化

机器学习 2020-09-28 v1 计算与语言 机器学习

摘要

我们表明,用于求解基于文本的游戏(TBGs)的强化学习(RL)方法通常无法在未见过的游戏上泛化,尤其是在小数据情形下。为解决此问题,我们提出了上下文相关片段状态截断(CREST),用于在观测文本中移除无关词元以改善泛化。我们的方法首先使用Q学习训练一个基础模型,该模型通常会过拟合训练游戏。基础模型的动作词元分布用于执行观测剪枝,移除无关词元。随后,第二个自举模型在剪枝后的观测文本上重新训练。我们的自举智能体在求解未见过的TextWorld游戏时表现出改进的泛化能力,与先前最先进的方法相比使用了少10倍至20倍的训练游戏,尽管所需的训练回合更少。

关键词

引用

@article{arxiv.2009.11896,
  title  = {Bootstrapped Q-learning with Context Relevant Observation Pruning to Generalize in Text-based Games},
  author = {Subhajit Chaudhury and Daiki Kimura and Kartik Talamadupula and Michiaki Tatsubori and Asim Munawar and Ryuki Tachibana},
  journal= {arXiv preprint arXiv:2009.11896},
  year   = {2020}
}

备注

Accepted to EMNLP 2020