中文

利用多模态知识图谱提升实体感知图像描述

计算机视觉与模式识别 2021-07-27 v1

摘要

实体感知图像描述旨在利用关联文章中的背景知识来描述与图像相关的命名实体和事件。该任务仍然具有挑战性,因为命名实体的长尾分布使得学习命名实体与视觉线索之间的关联变得困难。此外,文章的复杂性给提取实体间细粒度关系以生成关于图像的信息性事件描述带来了困难。为应对这些挑战,我们提出了一种新方法,通过构建多模态知识图谱,借助从网络收集的外部知识,将视觉对象与命名实体相关联,并同时捕捉实体间的关系。具体而言,我们通过从文章中提取命名实体及其关系来构建文本子图,并通过检测图像中的对象来构建图像子图。为连接这两个子图,我们提出了一个跨模态实体匹配模块,该模块使用包含维基百科条目及相应图像的知识库进行训练。最后,多模态知识图谱通过图注意力机制集成到描述模型中。在 GoodNews 和 NYTimes800k 数据集上的大量实验证明了我们方法的有效性。

关键词

引用

@article{arxiv.2107.11970,
  title  = {Boosting Entity-aware Image Captioning with Multi-modal Knowledge Graph},
  author = {Wentian Zhao and Yao Hu and Heda Wang and Xinxiao Wu and Jiebo Luo},
  journal= {arXiv preprint arXiv:2107.11970},
  year   = {2021}
}