中文

信息最大化的视觉问题生成

计算机视觉与模式识别 2019-03-28 v1

摘要

尽管图像到序列生成模型在人机交流中已变得极其流行,它们却严重偏向于安全的通用问题(“这张图片里有什么?”)。生成无信息但相关的问题并不充分也无用处。我们认为一个好的问题是具有紧密聚焦目的的问题——旨在期望特定类型回复的问题。我们构建了一个最大化图像、期望答案与生成问题之间互信息的模型。为克服离散自然语言令牌的不可微性,我们引入了期望答案所投影的变分连续潜空间。我们用第二个潜空间正则化该潜空间,以确保相似答案的聚类。即使我们不知道期望答案,该第二潜空间也能生成目标驱动的问题,专门旨在提取物体(“这个人正在扔什么”)、属性(“这个人穿着什么样的衬衫”)、颜色(“飞盘是什么颜色”)、材质(“飞盘是什么材质”)等。我们从定量上表明,我们的模型能够保留关于期望答案类别的信息,从而产生更多样化、目标驱动的问题。我们在一组真实世界图像上启动模型并提取先前未见的视觉概念。

关键词

引用

@article{arxiv.1903.11207,
  title  = {Information Maximizing Visual Question Generation},
  author = {Ranjay Krishna and Michael Bernstein and Li Fei-Fei},
  journal= {arXiv preprint arXiv:1903.11207},
  year   = {2019}
}

备注

CVPR 2019