中文

像词语一样表达对象:用于图文匹配的循环视觉嵌入

计算机视觉与模式识别 2020-02-21 v1

摘要

现有的图文匹配方法通常通过捕捉并聚合文本与图像中各个独立对象之间的亲和度来推断图文对的相似度。然而,它们忽略了语义相关对象之间的关联。这些对象可能共同决定图像是否与文本对应。为解决这个问题,我们提出一种双路径循环神经网络(DP-RNN),它通过循环神经网络(RNN)对称地处理图像与句子。具体而言,给定输入图文对,我们的模型根据各对象最相关词在文本中的位置对图像对象重排序。如同从词嵌入中提取隐藏特征一样,模型利用 RNN 从重排序后的对象输入中提取高层对象特征。我们验证了高层对象特征包含了语义相关对象的有用联合信息,有利于检索任务。为计算图文相似度,我们将一个多注意力交叉匹配模型整合进 DP-RNN。该模型通过跨模态引导注意力与自注意力聚合对象与词之间的亲和度。我们的模型在 Flickr30K 数据集上取得了当前最优性能,在 MS-COCO 数据集上取得了有竞争力的性能。大量实验证明了我们模型的有效性。

关键词

引用

@article{arxiv.2002.08510,
  title  = {Expressing Objects just like Words: Recurrent Visual Embedding for Image-Text Matching},
  author = {Tianlang Chen and Jiebo Luo},
  journal= {arXiv preprint arXiv:2002.08510},
  year   = {2020}
}

备注

Accepted by AAAI-20