中文

面向任务定位的动态注意力网络

计算机视觉与模式识别 2019-10-15 v1 计算与语言 机器学习

摘要

为了成功执行由自然语言指令指定的任务,在视觉世界中运行的人工智能体需要将指令中的词语、概念与动作映射到其环境中的视觉元素。这种关联被称为面向任务的定位(Task-Oriented Grounding)。在本工作中,我们提出了一种新颖的动态注意力网络架构,用于文本与视觉表示的高效多模态融合,从而可为策略学习器生成鲁棒的状态定义。我们的模型不假设来自视觉与文本领域的先验知识,并且是端到端可训练的。对于观测持续变化的 3D 视觉世界,视觉元素上的注意力在相邻时间步之间往往高度相关。我们称之为“动态注意力(Dynamic Attention)”。在本工作中,我们展示了动态注意力有助于实现定位,并辅助策略学习目标。由于大多数实际机器人应用发生在观测空间连续的真实世界中,我们的框架可用作通过自然语言进行机器人控制的通用多模态融合单元。我们展示了在门控注意力哈达玛积上使用一维卷积对网络收敛速度的有效性。我们论证了长短期记忆(LSTM)的单元状态是建模动态注意力的自然选择,并通过可视化表明所生成的注意力非常接近人类对环境聚焦的方式。

关键词

引用

@article{arxiv.1910.06315,
  title  = {Dynamic Attention Networks for Task Oriented Grounding},
  author = {Soumik Dasgupta and Badri N. Patro and Vinay P. Namboodiri},
  journal= {arXiv preprint arXiv:1910.06315},
  year   = {2019}
}

备注

Accepted ICCV 2019 Workshop