利用场景图接地复杂导航指令
机器学习
2021-06-04 v1 计算与语言
计算机视觉与模式识别
摘要
训练强化学习智能体执行自然语言指令受到可用监督的限制,即知道指令何时被执行完毕。我们改编 CLEVR 视觉问答数据集以生成复杂的自然语言导航指令及 accompanying 场景图,从而产生一个与环境无关的监督数据集。为展示该数据集的用途,我们将场景映射到 VizDoom 环境,并使用 \citet{gatedattention} 中的架构来训练一个智能体执行这些更复杂的语言指令。
引用
@article{arxiv.2106.01607,
title = {Grounding Complex Navigational Instructions Using Scene Graphs},
author = {Michiel de Jong and Satyapriya Krishna and Anuva Agarwal},
journal= {arXiv preprint arXiv:2106.01607},
year = {2021}
}
备注
arXiv admin note: text overlap with arXiv:1706.07230 by other authors