中文

问题中所包含的信息:将视觉问题用作一种监督形式

计算机视觉与模式识别 2017-04-14 v1

摘要

收集完全标注的图像数据集具有挑战性且成本高昂。已探索多种弱监督模式:弱人工标注、网络搜索结果、时间连续性、环境声音等。我们关注一种特定未探索的模式:针对图像提出的视觉问题。启发我们工作的关键观察是,问题本身提供了关于图像的有用信息(即使答案不可用)。例如,问题“狗的品种是什么?”告知AI场景中的动物是狗且只有一只狗。我们做出三点贡献:(1) 对人工视觉问题中包含的信息进行广泛的定性和定量分析;(2) 提出对标准视觉问答模型的两个简单却出乎意料有效的修改,使其能利用与图像相关的未回答问题形式的弱监督;(3) 展示受我们洞察启发的简单数据增强策略在标准VQA基准上带来7.1%的提升。

关键词

引用

@article{arxiv.1704.03895,
  title  = {What's in a Question: Using Visual Questions as a Form of Supervision},
  author = {Siddha Ganju and Olga Russakovsky and Abhinav Gupta},
  journal= {arXiv preprint arXiv:1704.03895},
  year   = {2017}
}

备注

CVPR 2017 Spotlight paper and supplementary