中文

超越字面意义的知识丰富图像要旨理解

信息检索 2019-04-19 v1 计算与语言 计算机视觉与模式识别

摘要

我们研究理解图像及其说明文字所传达的信息(要旨)的问题,例如网站或新闻文章中所见。为此,我们提出一种方法,基于大量机器可读知识来捕捉图像-说明文字对的意义,此类知识此前已被证明对文本理解极为有效。我们的方法辨识物体超越其指称的内涵:多数图像理解方法聚焦于物体的指称即其字面意义,而本工作致力于辨识内涵即物体的标志性意义,以理解图像的信息。我们将图像理解视为基于广泛覆盖的概念词汇表(如Wikipedia所提供的)来表示图像-说明文字对的任务,并将要旨检测构建为以图像-说明文字对为查询的概念排序问题。为深入探究要旨理解问题,我们制作了含300余对图像-说明文字及8000余条涵盖多抽象层级广泛主题的要旨标注的黄金标准。我们利用该数据集实验评估来自异构源(即图像与文本)信号的贡献。以平均精度均值(MAP)0.69取得的最佳结果表明,结合两个维度比单独使用语言或视觉信息更能理解图像-说明文字对的意义。我们测试了在接收自动生成输入(即使用自动生成的图像标签或生成说明文字)时要旨检测方法的鲁棒性,并证明了端到端自动化过程的可行性。

关键词

引用

@article{arxiv.1904.08709,
  title  = {Knowledge-rich Image Gist Understanding Beyond Literal Meaning},
  author = {Lydia Weiland and Ioana Hulpus and Simone Paolo Ponzetto and Wolfgang Effelsberg and Laura Dietz},
  journal= {arXiv preprint arXiv:1904.08709},
  year   = {2019}
}