中文

ICECAP:信息聚焦的实体感知图像描述生成

计算机视觉与模式识别 2021-08-05 v1 多媒体

摘要

当前大多数图像描述生成系统侧重于描述通用图像内容,缺乏背景知识来深度理解图像,例如确切的命名实体或具体事件。本文关注实体感知的新闻图像描述生成任务,旨在利用关联的新闻文章提供目标图像的背景知识,从而生成信息丰富的描述。然而,由于新闻文章篇幅较长,已有工作仅在粗粒度的文章或句子层面利用新闻文章,不足以精细地提炼相关事件并准确选择命名实体。为克服这些局限,我们提出一种信息聚焦的实体感知新闻图像描述生成(ICECAP)模型,它从句子层面到词层面逐步聚焦于对应新闻文章中的相关文本信息。我们的模型首先使用跨模态检索模型在相关句子上建立粗粒度聚焦,然后通过进一步聚焦于句子内相关词来生成描述。在 BreakingNews 与 GoodNews 数据集上的大量实验证明了我们所提方法的有效性,其优于其他 SOTA 方法。ICECAP 的代码公开于 https://github.com/HAWLYQ/ICECAP。

关键词

引用

@article{arxiv.2108.02050,
  title  = {ICECAP: Information Concentrated Entity-aware Image Captioning},
  author = {Anwen Hu and Shizhe Chen and Qin Jin},
  journal= {arXiv preprint arXiv:2108.02050},
  year   = {2021}
}

备注

9 pages, 7 figures, ACM MM 2020