用于图像描述生成的卷积解码器分析
计算机视觉与模式识别
2021-03-09 v1
摘要
近来,卷积神经网络已被提出用于序列建模任务,例如图像描述生成。然而,与循环神经网络不同,卷积神经网络作为图像描述生成解码器的性能尚未得到广泛研究。在这项工作中,我们分析了基于卷积神经网络的解码器的各个方面,例如网络复杂度和深度、数据增强的使用、注意力机制、训练时所用句子的长度等,对模型性能的影响。我们使用 Flickr8k 和 Flickr30k 图像描述数据集进行实验,观察到与基于循环神经网络的解码器不同,用于图像描述的卷积解码器通常不会从网络深度增加(以堆叠卷积层的形式)以及数据增强技术的使用中受益。此外,注意力机制的使用也为卷积解码器提供了有限的性能提升。进一步,我们观察到卷积解码器仅在使用包含最多 15 个单词的较短句子训练时才表现出与循环解码器相当的性能,但在使用更长句子长度训练时存在局限性,这表明卷积解码器可能无法高效建模长期依赖关系。此外,与循环解码器相比,卷积解码器在 CIDEr 评价指标上通常表现较差。
引用
@article{arxiv.2103.04914,
title = {Analysis of Convolutional Decoder for Image Caption Generation},
author = {Sulabh Katiyar and Samir Kumar Borgohain},
journal= {arXiv preprint arXiv:2103.04914},
year = {2021}
}
备注
18 pages, to be published in Book Series: Advances in Intelligent Systems and Computing - ISSN 2194-5357