中文

一种用于图文检索的深度局部与全局场景图匹配方法

计算机视觉与模式识别 2021-06-07 v1 信息检索 机器学习

摘要

传统的图文检索方法主要关注索引图片中出现的视觉对象,而忽略了这些对象之间的交互。此类对象出现情况及交互在该领域中同等有用且重要,因为它们通常在文本中被提及。场景图表示因能捕捉相互关系信息,是应对图文匹配挑战的合适方法并取得了良好结果。图像与文本均在场景图层级表示,并将检索挑战表述为场景图匹配挑战。本文中,我们提出局部与全局场景图匹配(LGSGM)模型,通过集成额外的图卷积网络以捕捉图的全局信息,增强了最先进方法。具体而言,对于图像及其描述文本的一对场景图,使用两个独立模型学习各图节点与边的特征;随后采用孪生结构图卷积模型将图嵌入为向量形式;最后结合图层级与向量层级计算该图文对的相似度。实证实验表明,我们所提出的层级结合增强方法在 Flickr30k 数据集上通过提升超过 10% 的召回率改进了基线方法性能。

关键词

引用

@article{arxiv.2106.02400,
  title  = {A Deep Local and Global Scene-Graph Matching for Image-Text Retrieval},
  author = {Manh-Duy Nguyen and Binh T. Nguyen and Cathal Gurrin},
  journal= {arXiv preprint arXiv:2106.02400},
  year   = {2021}
}