展示、讲述与判别:基于部分标注数据自检索的图像描述生成
计算机视觉与模式识别
2018-07-24 v3
摘要
图像描述生成的目标是让机器生成描述图像内容的字幕。尽管付出了许多努力,为图像生成具有判别性的字幕仍然并非易事。大多数传统方法模仿语言结构模式,因此往往陷入复制频繁短语或句子的窠臼,忽略了每张图像的独特之处。在这项工作中,我们提出了一个带有自检索模块作为训练指导的图像描述生成框架,以鼓励生成具有判别性的字幕。它带来了独特的优势:(1)自检索指导可以作为字幕判别性的度量和评估器,以确保生成字幕的质量。(2)生成字幕与图像之间的对应关系在生成过程中自然结合,无需人工标注,因此我们的方法可以利用大量未标注图像来提升描述生成性能,而无需额外繁重的标注。我们在 COCO 和 Flickr30k 描述数据集上展示了所提出的检索指导方法的有效性,并表明其通过更具判别性的字幕展现出更优的描述生成性能。
引用
@article{arxiv.1803.08314,
title = {Show, Tell and Discriminate: Image Captioning by Self-retrieval with Partially Labeled Data},
author = {Xihui Liu and Hongsheng Li and Jing Shao and Dapeng Chen and Xiaogang Wang},
journal= {arXiv preprint arXiv:1803.08314},
year = {2018}
}
备注
Accepted by ECCV 2018