中文

解耦式新颖物体描述生成器

计算机视觉与模式识别 2018-08-14 v2

摘要

图像描述生成是一项具有挑战性的任务,机器需自动用句子或短语描述图像。它通常需要大量配对的图像-句子标注用于训练。然而,预训练的描述生成模型很难应用于存在某些新颖物体类别的新领域,即这些物体及其描述词在模型训练期间未出现过。为正确描述新颖物体,需要专业人工使用含新颖词的句子标注图像。这成本高昂,从而限制了其在真实世界应用中的使用。本文中,我们引入零样本新颖物体描述生成任务,其中机器在无需关于新颖物体的额外句子的前提下生成描述。为应对该挑战性问题,我们提出一种解耦式新颖物体描述生成器(DNOC)框架,可充分将语言序列模型与物体描述解耦。DNOC 有两个组件。1) 带占位符的序列模型(SM-P)生成含占位符的句子。占位符代表未见的新颖物体。因此,序列模型可与新颖物体描述解耦。2) 基于免费可用检测模型构建的键值物体记忆,包含每个物体的视觉信息与对应词。SM-P 将生成查询以从物体记忆中检索词。占位符随后被填入正确词,得到含新颖物体描述的描述。在留出 MSCOCO 数据集上的实验结果展示了 DNOC 在零样本新颖物体描述生成任务中描述新颖概念的能力。

关键词

引用

@article{arxiv.1804.03803,
  title  = {Decoupled Novel Object Captioner},
  author = {Yu Wu and Linchao Zhu and Lu Jiang and Yi Yang},
  journal= {arXiv preprint arXiv:1804.03803},
  year   = {2018}
}

备注

Accepted to ACM MM 2018