中文

Visual News:新闻图像描述生成的基准与挑战

计算机视觉与模式识别 2021-09-15 v3

摘要

我们提出 Visual News Captioner,一种用于新闻图像描述生成任务的实体感知模型。我们还引入了 Visual News,一个由超过一百万张新闻图像及关联新闻文章、图像描述、作者信息与其他元数据组成的大规模基准。与标准图像描述任务不同,新闻图像描绘的场景中人物、地点和事件至关重要。我们提出的方法能有效结合视觉与文本特征,生成包含事件与实体等更丰富信息的描述。更具体地,基于 Transformer 架构,我们的模型进一步配备了新颖的多模态特征融合技术与注意力机制,旨在更准确地生成命名实体。我们的方法利用远更少参数,同时取得略优于对比方法的预测结果。我们规模更大且更多样的 Visual News 数据集进一步凸显了新闻图像描述生成中尚存的挑战。

关键词

引用

@article{arxiv.2010.03743,
  title  = {Visual News: Benchmark and Challenges in News Image Captioning},
  author = {Fuxiao Liu and Yinghan Wang and Tianlu Wang and Vicente Ordonez},
  journal= {arXiv preprint arXiv:2010.03743},
  year   = {2021}
}

备注

9 pages, 5 figures, accepted to EMNLP2021