随心图像描述生成:一种向图像描述高效注入情感的多功能方案
计算机视觉与模式识别
2018-01-31 v1
摘要
得益于计算机视觉与自然语言理解的最新进展,自动图像描述生成近来已接近人类水平。然而,当前大多数模型只能针对给定图像内容生成平实的客观描述。而对于人类而言,图像描述的写作十分灵活多样,常会融入情感、幽默与语言风格等额外语言维度,以产生多样、富有情感或吸引人的描述。我们尤其关注生成承载情感的图像描述,这一方向鲜有研究。主要挑战在于如何在不改变视觉内容与生成描述之间语义匹配的前提下,将情感有效注入所生成的标题。本工作中,我们提出两种不同的模型,采用不同方案将情感注入图像描述。与少数现有方法相比,所提模型更为简洁且更有效。实验结果表明,我们的模型在生成情感(即承载情感)图像描述方面优于最先进的模型。此外,我们还可通过为测试图像指定不同情感,轻松操控模型以生成具有相应情感的描述。
引用
@article{arxiv.1801.10121,
title = {Image Captioning at Will: A Versatile Scheme for Effectively Injecting Sentiments into Image Descriptions},
author = {Quanzeng You and Hailin Jin and Jiebo Luo},
journal= {arXiv preprint arXiv:1801.10121},
year = {2018}
}
备注
8 pages, 5 figures and 4 tables