利用强化学习将指令与视觉观测映射为动作
计算与语言
2017-07-25 v2
摘要
我们提出直接将原始视觉观测和文本输入映射为执行指令的动作。现有方法通常假设可获取结构化的环境表示,或使用分别训练的模型流水线,而我们学习单个模型以联合推理语言和视觉输入。我们在上下文多臂老虎机(contextual bandit)设置中使用强化学习来训练神经网络智能体。为引导智能体的探索,我们利用不同形式的监督进行奖励塑造(reward shaping)。我们的方法不需要中间表示、规划过程或训练不同的模型。我们在模拟环境中进行评估,结果显示其显著优于监督学习和常见的强化学习变体。
引用
@article{arxiv.1704.08795,
title = {Mapping Instructions and Visual Observations to Actions with Reinforcement Learning},
author = {Dipendra Misra and John Langford and Yoav Artzi},
journal= {arXiv preprint arXiv:1704.08795},
year = {2017}
}
备注
In Proceedings of the Conference on Empirical Methods in Natural Language Processing (EMNLP), 2017