中文

学习配置神经模块用于图像描述生成

计算机视觉与模式识别 2019-04-19 v1

摘要

我们并非从零开始逐词说话;我们的大脑快速构建如\textsc{某物在某地做某事}这样的模式,然后填入详细描述。为使现有编码器-解码器图像描述生成器具备此类类人推理能力,我们提出一种新框架:学习配置神经模块(CNM),以生成连接视觉编码器与语言解码器的“内部模式”。不同于视觉问答中广泛使用的神经模块网络(其中语言即问题完全可观测),用于描述生成的CNM更具挑战性,因为语言正在生成中因而部分可观测。为此,我们为CNM训练做出以下技术贡献:1)紧凑模块设计——一个用于功能词,三个用于视觉内容词(如名词、形容词和动词);2)软模块融合与多步模块执行,在部分观测下使视觉推理更鲁棒;3)用于模块控制器忠实于词性搭配(如形容词在名词前)的语言学损失。在具有挑战性的MS-COCO图像描述生成基准上的大量实验验证了我们的CNM图像描述生成器的有效性。特别地,CNM在Karpathy划分上取得了新的最先进127.9 CIDEr-D,以及在官方服务器上单模型126.0 c40。CNM对少量训练样本也具鲁棒性,例如每幅图像仅训练一个句子,CNM相比强基线可减半性能损失。

关键词

引用

@article{arxiv.1904.08608,
  title  = {Learning to Collocate Neural Modules for Image Captioning},
  author = {Xu Yang and Hanwang Zhang and Jianfei Cai},
  journal= {arXiv preprint arXiv:1904.08608},
  year   = {2019}
}