IQA:交互式环境中的视觉问答
计算机视觉与模式识别
2018-09-07 v3
摘要
我们提出交互式问答(IQA),即要求自主智能体与动态视觉环境交互来回答问题的任务。IQA 向智能体呈现一个场景和一个问题,例如:“冰箱里有苹果吗?”智能体必须在场景中导航,获取对场景元素的视觉理解,与物体交互(如打开冰箱)并基于问题规划一系列动作。由于巨大且多样的状态空间,流行的具有单一控制器的强化学习方法在 IQA 上表现不佳。我们提出层次化交互记忆网络(HIMN),由一组因子化控制器组成,使系统能在多时间抽象层级上运作。为评估 HIMN,我们引入 IQUAD V1,一个基于 AI2-THOR 构建的新数据集,AI2-THOR 是一个具有可配置室内场景与可交互物体的模拟照片级真实环境(代码与数据集见 https://github.com/danielgordon10/thor-iqa-cvpr-2018)。IQUAD V1 含有 75,000 个问题,每个配对唯一场景配置。我们的实验表明所提模型在 IQUAD V1 上优于流行的基于单一控制器的方法。示例问题与结果请见视频:https://youtu.be/pXd3C-1jr98
引用
@article{arxiv.1712.03316,
title = {IQA: Visual Question Answering in Interactive Environments},
author = {Daniel Gordon and Aniruddha Kembhavi and Mohammad Rastegari and Joseph Redmon and Dieter Fox and Ali Farhadi},
journal= {arXiv preprint arXiv:1712.03316},
year = {2018}
}
备注
Published in CVPR 2018