ICECAP:信息聚焦的实体感知图像描述生成
计算机视觉与模式识别
2021-08-05 v1 多媒体
摘要
当前大多数图像描述生成系统侧重于描述通用图像内容,缺乏背景知识来深度理解图像,例如确切的命名实体或具体事件。本文关注实体感知的新闻图像描述生成任务,旨在利用关联的新闻文章提供目标图像的背景知识,从而生成信息丰富的描述。然而,由于新闻文章篇幅较长,已有工作仅在粗粒度的文章或句子层面利用新闻文章,不足以精细地提炼相关事件并准确选择命名实体。为克服这些局限,我们提出一种信息聚焦的实体感知新闻图像描述生成(ICECAP)模型,它从句子层面到词层面逐步聚焦于对应新闻文章中的相关文本信息。我们的模型首先使用跨模态检索模型在相关句子上建立粗粒度聚焦,然后通过进一步聚焦于句子内相关词来生成描述。在 BreakingNews 与 GoodNews 数据集上的大量实验证明了我们所提方法的有效性,其优于其他 SOTA 方法。ICECAP 的代码公开于 https://github.com/HAWLYQ/ICECAP。
引用
@article{arxiv.2108.02050,
title = {ICECAP: Information Concentrated Entity-aware Image Captioning},
author = {Anwen Hu and Shizhe Chen and Qin Jin},
journal= {arXiv preprint arXiv:2108.02050},
year = {2021}
}
备注
9 pages, 7 figures, ACM MM 2020