RTFM:通过阅读泛化到新颖环境动态
计算与语言
2021-02-03 v6 人工智能
机器学习
摘要
在强化学习中获得能泛化到新环境的策略具有挑战性。本工作中,我们证明通过阅读策略学习器进行语言理解是泛化到新环境的一种有前景的途径。我们提出一个具身策略学习问题——阅读打怪物 (RTFM),其中智能体必须联合推理语言目标、文档中描述的相关动态以及环境观测。我们程序化生成环境动态及相应的动态语言描述,使得智能体必须通过阅读来理解新环境动态,而非记忆任何特定信息。此外,我们提出 txt2,一个捕获目标、文档和观测三者交互的模型。在 RTFM 上,txt2 通过阅读泛化到训练期间未见过动态的新环境。而且,我们的模型在 RTFM 上优于 FiLM 和语言条件 CNN 等基线。通过课程学习,txt2 产生在需要若干推理和共指步骤的复杂 RTFM 任务上表现出色的策略。
引用
@article{arxiv.1910.08210,
title = {RTFM: Generalising to Novel Environment Dynamics via Reading},
author = {Victor Zhong and Tim Rocktäschel and Edward Grefenstette},
journal= {arXiv preprint arXiv:1910.08210},
year = {2021}
}
备注
ICLR 2020; 17 pages, 13 figures