基于单步奖励观测的情境化序列指令到动作的映射
计算与语言
2018-06-12 v2
摘要
我们提出了一种将依赖于上下文的序列指令映射到动作的学习方法。我们使用一个基于注意力的模型来解决话语和状态依赖问题,该模型同时考虑了交互历史和世界状态。为了在没有示范的情况下从起始状态和目标状态进行训练,我们提出了 SESTRA,这是一种利用单步奖励观测和即时预期奖励最大化的学习算法。我们在 SCONE 域上进行了评估,结果表明,与使用高级逻辑表示的方法相比,各域的绝对准确率提高了 9.8%-25.3%。
引用
@article{arxiv.1805.10209,
title = {Situated Mapping of Sequential Instructions to Actions with Single-step Reward Observation},
author = {Alane Suhr and Yoav Artzi},
journal= {arXiv preprint arXiv:1805.10209},
year = {2018}
}
备注
ACL 2018 Long Paper