中文

用于图文匹配的共识感知视觉-语义嵌入

计算机视觉与模式识别 2021-02-02 v2

摘要

图文匹配在连接视觉与语言中起着核心作用。多数现有方法仅依赖图文实例对来学习其表示,从而利用它们的匹配关系并作出相应对齐。此类方法仅挖掘了实例成对数据中所含的表层关联,未考虑任何外部常识知识,这可能阻碍其推理图像与文本间更高层次关系的能力。本文提出一种共识感知视觉-语义嵌入(CVSE)模型,将共识信息(即两模态间共享的常识知识)引入图文匹配。具体而言,通过计算来自图像描述语料的语义概念间的统计共现相关性,并部署所构建的概念相关图来产生共识感知概念(CAC)表示,从而利用共识信息。之后,CVSE 基于所挖掘的共识以及两模态的实例级表示,学习图像与文本间的关联与对齐。在两个公开数据集上的大量实验验证,所挖掘的共识对构建更有意义的视觉-语义嵌入贡献显著,在双向图像与文本检索任务上优于最先进方法。本文代码见:https://github.com/BruceW91/CVSE。

关键词

引用

@article{arxiv.2007.08883,
  title  = {Consensus-Aware Visual-Semantic Embedding for Image-Text Matching},
  author = {Haoran Wang and Ying Zhang and Zhong Ji and Yanwei Pang and Lin Ma},
  journal= {arXiv preprint arXiv:2007.08883},
  year   = {2021}
}

备注

Accepted by ECCV 2020, Code is publicly available at: https://github.com/BruceW91/CVSE