学习配置神经模块用于图像描述生成
计算机视觉与模式识别
2019-04-19 v1
摘要
我们并非从零开始逐词说话;我们的大脑快速构建如\textsc{某物在某地做某事}这样的模式,然后填入详细描述。为使现有编码器-解码器图像描述生成器具备此类类人推理能力,我们提出一种新框架:学习配置神经模块(CNM),以生成连接视觉编码器与语言解码器的“内部模式”。不同于视觉问答中广泛使用的神经模块网络(其中语言即问题完全可观测),用于描述生成的CNM更具挑战性,因为语言正在生成中因而部分可观测。为此,我们为CNM训练做出以下技术贡献:1)紧凑模块设计——一个用于功能词,三个用于视觉内容词(如名词、形容词和动词);2)软模块融合与多步模块执行,在部分观测下使视觉推理更鲁棒;3)用于模块控制器忠实于词性搭配(如形容词在名词前)的语言学损失。在具有挑战性的MS-COCO图像描述生成基准上的大量实验验证了我们的CNM图像描述生成器的有效性。特别地,CNM在Karpathy划分上取得了新的最先进127.9 CIDEr-D,以及在官方服务器上单模型126.0 c40。CNM对少量训练样本也具鲁棒性,例如每幅图像仅训练一个句子,CNM相比强基线可减半性能损失。
引用
@article{arxiv.1904.08608,
title = {Learning to Collocate Neural Modules for Image Captioning},
author = {Xu Yang and Hanwang Zhang and Jianfei Cai},
journal= {arXiv preprint arXiv:1904.08608},
year = {2019}
}