中文

IQA:交互式环境中的视觉问答

计算机视觉与模式识别 2018-09-07 v3

摘要

我们提出交互式问答(IQA),即要求自主智能体与动态视觉环境交互来回答问题的任务。IQA 向智能体呈现一个场景和一个问题,例如:“冰箱里有苹果吗?”智能体必须在场景中导航,获取对场景元素的视觉理解,与物体交互(如打开冰箱)并基于问题规划一系列动作。由于巨大且多样的状态空间,流行的具有单一控制器的强化学习方法在 IQA 上表现不佳。我们提出层次化交互记忆网络(HIMN),由一组因子化控制器组成,使系统能在多时间抽象层级上运作。为评估 HIMN,我们引入 IQUAD V1,一个基于 AI2-THOR 构建的新数据集,AI2-THOR 是一个具有可配置室内场景与可交互物体的模拟照片级真实环境(代码与数据集见 https://github.com/danielgordon10/thor-iqa-cvpr-2018)。IQUAD V1 含有 75,000 个问题,每个配对唯一场景配置。我们的实验表明所提模型在 IQUAD V1 上优于流行的基于单一控制器的方法。示例问题与结果请见视频:https://youtu.be/pXd3C-1jr98

关键词

引用

@article{arxiv.1712.03316,
  title  = {IQA: Visual Question Answering in Interactive Environments},
  author = {Daniel Gordon and Aniruddha Kembhavi and Mohammad Rastegari and Joseph Redmon and Dieter Fox and Ali Farhadi},
  journal= {arXiv preprint arXiv:1712.03316},
  year   = {2018}
}

备注

Published in CVPR 2018