中文

基于多模态张量融合与重排序的图像与文本匹配

计算机视觉与模式识别 2020-07-30 v2

摘要

图像与文本匹配的一个主要挑战在于二者具有本质不同的数据分布与特征表示。大多数现有方法基于嵌入或分类,前者将图像与文本实例映射至公共嵌入空间以度量距离,后者将图文匹配视为二分类问题。然而,这些方法均无法很好地平衡匹配精度与模型复杂度。我们提出一种新颖框架,以可接受的模型复杂度实现卓越的匹配性能。具体而言,在训练阶段,我们提出一种新颖的多模态张量融合网络(MTFN),通过基于排序的张量融合显式学习精确的图像-文本相似度函数,而非为每个图文实例寻找公共嵌入空间。随后,在测试阶段,我们部署一种通用的跨模态重排序(RR)方案进行精炼,无需额外训练过程。在两个数据集上的大量实验表明,我们的 MTFN-RR 以低得多的时空复杂度持续达到最先进的匹配性能。实现代码可在 https://github.com/Wangt-CN/MTFN-RR-PyTorch-Code 获取。

关键词

引用

@article{arxiv.1908.04011,
  title  = {Matching Images and Text with Multi-modal Tensor Fusion and Re-ranking},
  author = {Tan Wang and Xing Xu and Yang Yang and Alan Hanjalic and Heng Tao Shen and Jingkuan Song},
  journal= {arXiv preprint arXiv:1908.04011},
  year   = {2020}
}

备注

ACM Multimedia 2019 Oral