中文

基于单步奖励观测的情境化序列指令到动作的映射

计算与语言 2018-06-12 v2

摘要

我们提出了一种将依赖于上下文的序列指令映射到动作的学习方法。我们使用一个基于注意力的模型来解决话语和状态依赖问题,该模型同时考虑了交互历史和世界状态。为了在没有示范的情况下从起始状态和目标状态进行训练,我们提出了 SESTRA,这是一种利用单步奖励观测和即时预期奖励最大化的学习算法。我们在 SCONE 域上进行了评估,结果表明,与使用高级逻辑表示的方法相比,各域的绝对准确率提高了 9.8%-25.3%。

关键词

引用

@article{arxiv.1805.10209,
  title  = {Situated Mapping of Sequential Instructions to Actions with Single-step Reward Observation},
  author = {Alane Suhr and Yoav Artzi},
  journal= {arXiv preprint arXiv:1805.10209},
  year   = {2018}
}

备注

ACL 2018 Long Paper