中文

“写实”或“情感”:基于自适应学习与注意力机制的风化图像描述生成

计算机视觉与模式识别 2018-07-31 v3

摘要

为图像生成风格化描述(stylized caption)是图像描述生成领域的一个新兴课题。给定一张图像作为输入,它要求系统在语义准确地描述图像内容的同时,生成具有特定风格(如幽默、浪漫、积极、消极)的描述。本文提出一种新颖的风格化图像描述生成模型,有效兼顾上述两项要求。为此,我们首先设计了一种 LSTM 的新变体,称为风格-写实 LSTM(style-factual LSTM),作为模型的构建模块。它使用两组矩阵分别捕捉写实知识与风格化知识,并基于先前上下文自动学习两组在词级别的权重。此外,在训练模型以捕捉风格化要素时,我们提出一种基于参考写实模型的自适应学习方法,该方法在模型从风格化描述标签中学习时为其提供写实知识,并能自适应地计算每一步应提供的信息量。我们在两个风格化图像描述数据集上评估了我们的模型,它们分别包含幽默/浪漫描述和积极/消极描述。实验表明,无需使用额外的真实标注监督,我们提出的模型优于当前最优(state-of-the-art)方法。

关键词

引用

@article{arxiv.1807.03871,
  title  = {"Factual" or "Emotional": Stylized Image Captioning with Adaptive Learning and Attention},
  author = {Tianlang Chen and Zhongping Zhang and Quanzeng You and Chen Fang and Zhaowen Wang and Hailin Jin and Jiebo Luo},
  journal= {arXiv preprint arXiv:1807.03871},
  year   = {2018}
}

备注

17 pages, 7 figures, ECCV 2018