通过对抗训练生成风格化图像描述
计算机视觉与模式识别
2019-08-09 v1 计算与语言
摘要
虽然大多数图像描述旨在生成对图像的客观描述,但过去几年已出现针对生成具有特定风格(例如融入正面或负面情感)的视觉接地图像描述的研究。然而,由于风格成分通常是训练的最后部分,当前模型往往更关注风格而牺牲了准确的内容描述。此外,风格方面的多样性不足。为解决这些问题,我们提出了一种称为 ATTEND-GAN 的图像描述模型,其包含两个核心组件:第一,基于注意力的描述生成器,将图像的不同部分与描述的不同部分强相关地关联起来;第二,对抗训练机制,辅助描述生成器向生成的描述中添加多样的风格成分。得益于这些组件,ATTEND-GAN 能够生成相关的描述以及更具人类风格的风格模式多样性。我们的系统优于当前最优(SOTA)方法以及我们的一组基线模型。对生成描述的语言学分析表明,使用 ATTEND-GAN 生成的描述具有更广泛的风格化形容词和形容词-名词组合。
引用
@article{arxiv.1908.02943,
title = {Towards Generating Stylized Image Captions via Adversarial Training},
author = {Omid Mohamad Nezami and Mark Dras and Stephen Wan and Cecile Paris and Len Hamey},
journal= {arXiv preprint arXiv:1908.02943},
year = {2019}
}