由词性引导的快速、多样且准确的图像描述生成
计算机视觉与模式识别
2019-04-12 v3
摘要
图像描述生成是一个歧义性问题,一幅图像有许多合适的描述。为处理歧义,束搜索是采样多个描述的事实标准方法。然而,束搜索计算代价高,且已知会产生通用描述。为解决此问题,已提出一些基于变分自编码器 (VAE) 和生成对抗网络 (GAN) 的方法。尽管多样,GAN 和 VAE 准确性较低。本文中,我们首先预测图像的有意义摘要,再基于该摘要生成描述。我们使用词性作为摘要,因为我们的摘要应驱动描述生成。我们实现了三重目标:(1) 由标准描述指标和用户研究评估的多样描述的高准确性;(2) 相比束搜索和多样束搜索,多样描述计算更快;(3) 由统计新句子、不同 n-gram 和互重叠(即 mBleu-4)分数评估的高多样性。
引用
@article{arxiv.1805.12589,
title = {Fast, Diverse and Accurate Image Captioning Guided By Part-of-Speech},
author = {Aditya Deshpande and Jyoti Aneja and Liwei Wang and Alexander Schwing and D. A. Forsyth},
journal= {arXiv preprint arXiv:1805.12589},
year = {2019}
}
备注
12 pages with references and appendix. To appear CVPR'19