中文

FlipDial:一种用于双向视觉对话的生成模型

计算机视觉与模式识别 2018-04-04 v2

摘要

我们提出 FlipDial,一种用于视觉对话的生成模型,它同时扮演基于视觉的对话中双方参与者的角色。给定以图像和概括图像内容的关联描述作为形式的环境信息,FlipDial 同时学习回答问题和提出问题,能够生成多样化且与图像相关的完整对话序列(问答对)。为此,FlipDial 依赖于一个简单却出奇强大的想法:它使用卷积神经网络(CNNs)直接编码整个对话,隐式地捕捉对话上下文,并使用条件 VAE 来学习生成模型。在 VisDial 数据集上,FlipDial 在顺序回答任务(单向视觉对话)中比最先进的模型在平均排名(Mean Rank)上高出 5 个点(使用生成的答案)。我们首次将该范式扩展到完整的双向视觉对话,其中我们的模型能够基于视觉输入顺序生成问题和答案,为此我们提出了一组新颖的评估方法和指标。

关键词

引用

@article{arxiv.1802.03803,
  title  = {FlipDial: A Generative Model for Two-Way Visual Dialogue},
  author = {Daniela Massiceti and N. Siddharth and Puneet K. Dokania and Philip H. S. Torr},
  journal= {arXiv preprint arXiv:1802.03803},
  year   = {2018}
}