将语言锚定于实体与环境动态以实现强化学习中的泛化
计算与语言
2021-06-15 v2 人工智能
机器学习
摘要
我们研究自然语言驱动控制策略泛化的使用,并引入新的多任务环境 Messenger,其带有描述环境动态的自由文本手册。与先前工作不同,Messenger 不假设文本与状态观测间存在先验知识连接——控制策略必须同时将游戏手册锚定于环境中的实体符号与动态。我们提出新模型 EMMA(带多模态注意力的实体映射器),其使用实体条件注意力模块,允许针对环境中每个实体对手册中相关描述进行选择性聚焦。EMMA 端到端可微,并仅利用环境奖励从文本到观测学习实体与动态的潜在锚定。EMMA 对具有新动态的无见过的游戏实现了成功的零样本泛化,相较多个基线获得高 40% 的胜率。然而,Messenger 最难阶段的胜率仍低(10%),表明该方向需进一步工作。
引用
@article{arxiv.2101.07393,
title = {Grounding Language to Entities and Dynamics for Generalization in Reinforcement Learning},
author = {Austin W. Hanjie and Victor Zhong and Karthik Narasimhan},
journal= {arXiv preprint arXiv:2101.07393},
year = {2021}
}
备注
Accepted to ICML 2021. Note author list and name changes from previous version