中文

利用场景图接地复杂导航指令

机器学习 2021-06-04 v1 计算与语言 计算机视觉与模式识别

摘要

训练强化学习智能体执行自然语言指令受到可用监督的限制,即知道指令何时被执行完毕。我们改编 CLEVR 视觉问答数据集以生成复杂的自然语言导航指令及 accompanying 场景图,从而产生一个与环境无关的监督数据集。为展示该数据集的用途,我们将场景映射到 VizDoom 环境,并使用 \citet{gatedattention} 中的架构来训练一个智能体执行这些更复杂的语言指令。

关键词

引用

@article{arxiv.2106.01607,
  title  = {Grounding Complex Navigational Instructions Using Scene Graphs},
  author = {Michiel de Jong and Satyapriya Krishna and Anuva Agarwal},
  journal= {arXiv preprint arXiv:2106.01607},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:1706.07230 by other authors