SemStyle:利用非对齐文本生成风格化图像描述
计算机视觉与模式识别
2018-05-21 v1
摘要
语言风格是书面交流的基本要素,能够影响表达的清晰性与吸引力。随着视觉与语言的最新进展,我们开始着手解决生成既具视觉依据又风格得当的图像描述问题。现有方法要么需要图像对齐的风格化训练描述,要么生成相关性低的描述。我们提出了一种模型,可从大规模风格化文本语料中学习生成视觉相关且具风格的图片描述,而无需对齐图像。该模型称为SemStyle,其核心思想是分离语义与风格。其中一个关键组成部分是利用自然语言处理技术与框架语义生成的新颖简洁语义项表示。此外,我们开发了统一语言模型,可针对不同风格解码出具有多样词汇选择和句法的句子。自动与人工评估均表明,SemStyle生成的描述保留了图像语义、具有描述性且发生了风格偏移。更广泛地,本工作为从网络上大量语言数据中学习更丰富的图像描述提供了可能。
引用
@article{arxiv.1805.07030,
title = {SemStyle: Learning to Generate Stylised Image Captions using Unaligned Text},
author = {Alexander Mathews and Lexing Xie and Xuming He},
journal= {arXiv preprint arXiv:1805.07030},
year = {2018}
}
备注
Accepted at CVPR 2018