中文

视觉对话

计算机视觉与模式识别 2017-08-03 v5 人工智能 计算与语言 机器学习

摘要

我们引入了视觉对话(Visual Dialog)任务,其要求 AI 智能体就视觉内容用自然、对话性的语言与人类进行有意义的对话。具体而言,给定一张图像、一段对话历史以及关于该图像的一个问题,智能体必须将问题立足于图像、从历史推断上下文并准确回答问题。视觉对话与特定下游任务充分解耦,从而可作为机器智能的通用测试,同时其立足于视觉足以允许对单个响应进行客观评估和基准进展衡量。我们开发了一种新颖的双人聊天数据收集协议,以策划大规模视觉对话数据集(VisDial)。VisDial v0.9 已发布,包含约 120k 张来自 COCO 的图像上每图 1 个对话、10 个问答对,总计约 1.2M 个对话问答对。我们引入了一系列用于视觉对话的神经编码器-解码器模型,具有 3 种编码器——后期融合(Late Fusion)、层次循环编码器(Hierarchical Recurrent Encoder)和记忆网络(Memory Network)——以及 2 种解码器(生成式和判别式),其性能优于多个复杂基线。我们提出了一种基于检索的视觉对话评估协议,其中要求 AI 智能体对一组候选答案进行排序,并根据诸如人类响应的平均倒数排名(mean-reciprocal-rank)等指标进行评估。我们通过人类研究量化了机器与人类在视觉对话任务上的差距。综合起来,我们展示了首个“视觉聊天机器人”!我们的数据集、代码、训练模型和视觉聊天机器人可在 https://visualdialog.org 获取。

关键词

引用

@article{arxiv.1611.08669,
  title  = {Visual Dialog},
  author = {Abhishek Das and Satwik Kottur and Khushi Gupta and Avi Singh and Deshraj Yadav and José M. F. Moura and Devi Parikh and Dhruv Batra},
  journal= {arXiv preprint arXiv:1611.08669},
  year   = {2017}
}

备注

23 pages, 18 figures, CVPR 2017 camera-ready, results on VisDial v0.9 dataset, Webpage: http://visualdialog.org