ParaCNN:通过对抗孪生上下文 CNN 生成视觉段落
计算机视觉与模式识别
2020-04-23 v1
摘要
图像描述生成在许多现实应用中起着重要作用,例如图像检索、自动导航和残障人士辅助。图像描述生成的一个成熟任务是图像字幕,其通常生成简短的说明句,从而忽略了诸多细粒度属性,例如细微对象及其关系的信息。在本文中,我们研究视觉段落生成,其可用包含丰富细节的长段落描述图像。以往研究常通过分层类循环神经网络(RNN)模型生成段落,该模型具有复杂的记忆、遗忘与耦合机制。相反,我们提出一种新颖的纯 CNN 模型 ParaCNN,利用段落内句子间的上下文信息以分层 CNN 架构生成视觉段落。ParaCNN 可生成任意长度的段落,在许多现实应用中更具适用性。此外,为使 ParaCNN 能全面建模段落,我们还提出一种对抗孪生网络训练方案。在训练中,我们通过对抗训练迫使前向网络的隐藏特征接近后向网络的特征。在测试中,我们仅使用已包含后向网络知识的前向网络来生成段落。我们在斯坦福视觉段落数据集上进行了大量实验,取得了最先进的性能。
引用
@article{arxiv.2004.10258,
title = {ParaCNN: Visual Paragraph Generation via Adversarial Twin Contextual CNNs},
author = {Shiyang Yan and Yang Hua and Neil Robertson},
journal= {arXiv preprint arXiv:2004.10258},
year = {2020}
}