中文

用于关系感知图文检索的跨模态场景图匹配

计算机视觉与模式识别 2019-10-14 v1

摘要

自然场景的图文检索一直是一个热门的研究课题。由于图像和文本是异构的跨模态数据,关键挑战之一是如何学习全面而统一的表示来表达多模态数据。自然场景图像主要涉及两类视觉概念,即物体及其关系,它们对图文检索同等重要。因此,一个好的表示应同时考虑两者。鉴于场景图在描述复杂自然场景的许多 CV 和 NLP 任务中近期的成功,我们提出用两种场景图来表示图像和文本:视觉场景图(VSG)和文本场景图(TSG),每种都用于联合刻画相应模态中的物体和关系。图文检索任务随后自然地被表述为跨模态场景图匹配。具体而言,我们在模型中为 VSG 和 TSG 设计了两个特定的场景图编码器,它们能通过聚合邻域信息来精炼图上每个节点的表示。因此,可以获得物体级和关系级的跨模态特征,这使我们能够以更合理的方式在两个层级上评估图像与文本的相似度。我们在 Flickr30k 和 MSCOCO 上取得了 state-of-the-art 结果,验证了我们的基于图匹配的方法用于图文检索的优势。

关键词

引用

@article{arxiv.1910.05134,
  title  = {Cross-modal Scene Graph Matching for Relationship-aware Image-Text Retrieval},
  author = {Sijin Wang and Ruiping Wang and Ziwei Yao and Shiguang Shan and Xilin Chen},
  journal= {arXiv preprint arXiv:1910.05134},
  year   = {2019}
}

备注

Accepted by WACV 2020