中文

用于改进图像字幕生成的场景图生成?

计算机视觉与模式识别 2021-09-24 v1

摘要

我们研究将视觉关系引入有监督图像字幕生成任务,提出一种利用检测到的物体与自动生成的视觉关系以自然语言描述图像的模型。为此,我们首先从原始图像像素生成场景图,识别其中的个体物体及它们之间的视觉关系。该场景图随后作为我们图到文本模型的输入,生成最终字幕。与以往方法不同,我们的模型因而显式建模图像中物体与视觉关系的检测。在实验中,我们从Visual Genome与MS COCO的交集中构建了一个新数据集,包含同时具有对应金标准场景图与人工撰写字幕的图像。我们的结果表明,在BLEU与METEOR评价指标下,与现有直接从原始输入像素生成图像描述的端到端最优(state-of-the-art)模型相比,我们的方法更优。

关键词

引用

@article{arxiv.2109.11398,
  title  = {Scene Graph Generation for Better Image Captioning?},
  author = {Maximilian Mozes and Martin Schmitt and Vladimir Golkov and Hinrich Schütze and Daniel Cremers},
  journal= {arXiv preprint arXiv:2109.11398},
  year   = {2021}
}

备注

Technical report. This work was done and the paper was written in 2019