中文

由词性引导的快速、多样且准确的图像描述生成

计算机视觉与模式识别 2019-04-12 v3

摘要

图像描述生成是一个歧义性问题,一幅图像有许多合适的描述。为处理歧义,束搜索是采样多个描述的事实标准方法。然而,束搜索计算代价高,且已知会产生通用描述。为解决此问题,已提出一些基于变分自编码器 (VAE) 和生成对抗网络 (GAN) 的方法。尽管多样,GAN 和 VAE 准确性较低。本文中,我们首先预测图像的有意义摘要,再基于该摘要生成描述。我们使用词性作为摘要,因为我们的摘要应驱动描述生成。我们实现了三重目标:(1) 由标准描述指标和用户研究评估的多样描述的高准确性;(2) 相比束搜索和多样束搜索,多样描述计算更快;(3) 由统计新句子、不同 n-gram 和互重叠(即 mBleu-4)分数评估的高多样性。

关键词

引用

@article{arxiv.1805.12589,
  title  = {Fast, Diverse and Accurate Image Captioning Guided By Part-of-Speech},
  author = {Aditya Deshpande and Jyoti Aneja and Liwei Wang and Alexander Schwing and D. A. Forsyth},
  journal= {arXiv preprint arXiv:1805.12589},
  year   = {2019}
}

备注

12 pages with references and appendix. To appear CVPR'19