中文

转换并叙述:实体感知的新闻图像字幕生成

计算机视觉与模式识别 2020-06-16 v2 计算与语言

摘要

我们提出了一种端到端模型,用于为新闻文章中的嵌入图像生成字幕。新闻图像带来两个关键挑战:它们依赖于真实世界知识,尤其是关于命名实体的知识;并且它们通常具有语言丰富的字幕,其中包含不常见的词汇。我们通过一种多模态、多头注意力机制,将字幕中的单词与图像中的人脸和物体相关联,从而应对第一个挑战。我们通过一个最先进的 transformer 语言模型来解决第二个挑战,该模型使用字节对编码(byte-pair-encoding)将字幕生成为词片段序列。在 GoodNews 数据集上,我们的模型在 CIDEr 分数上以四倍的优势超越先前的最先进水平(从 13 提升至 54)。这一性能提升源于语言模型、词表示、图像嵌入、人脸嵌入、物体嵌入以及神经网络设计改进的独特组合。我们还引入了 NYTimes800k 数据集,其规模比 GoodNews 大 70%,具有更高的文章质量,并包含图像在文章中的位置作为额外的上下文线索。

关键词

引用

@article{arxiv.2004.08070,
  title  = {Transform and Tell: Entity-Aware News Image Captioning},
  author = {Alasdair Tran and Alexander Mathews and Lexing Xie},
  journal= {arXiv preprint arXiv:2004.08070},
  year   = {2020}
}

备注

Published in CVPR 2020. Code is available at https://github.com/alasdairtran/transform-and-tell and demo is available at https://transform-and-tell.ml