CNN+CNN:用于图像描述生成的卷积解码器
计算机视觉与模式识别
2018-05-24 v1
摘要
图像描述生成是一项结合了计算机视觉与自然语言处理领域的挑战性任务。为实现自动描述图像的目标已提出多种方法,基于循环神经网络(RNN)或长短期记忆(LSTM)的模型主导了该领域。然而,RNN 或 LSTM 无法并行计算,且忽略了句子的底层层次结构。在本文中,我们提出一种仅采用卷积神经网络(CNN)来生成描述的框架。得益于并行计算,我们的基础模型在训练时比 NIC(一种基于 LSTM 的模型)快约 3 倍,同时也提供了更好的结果。我们在 MSCOCO 上进行了大量实验并探究了模型宽度与深度的影响。相较于应用了相似注意力机制的基于 LSTM 的模型,我们提出的模型取得了可比的 BLEU-1,2,3,4 与 METEOR 分数,以及更高的 CIDEr 分数。我们还在段落标注数据集上测试了我们的模型,并取得了比层次化 LSTM 更高的 CIDEr 分数。
引用
@article{arxiv.1805.09019,
title = {CNN+CNN: Convolutional Decoders for Image Captioning},
author = {Qingzhong Wang and Antoni B. Chan},
journal= {arXiv preprint arXiv:1805.09019},
year = {2018}
}