中文

超越深度度量学习:通过对抗判别域正则化增强跨模态匹配

计算机视觉与模式识别 2020-10-29 v2

摘要

跨图像与文本模态匹配信息涉及视觉与自然语言处理诸多应用的基本挑战。其目标是寻找高效的相似性度量来比较视觉与文本信息的相似度。现有方法主要在共享空间中利用注意力机制匹配局部视觉对象与句子单词。由于相似性计算基于匹配特征的简单比较,忽略了其在数据中的分布特性,匹配性能仍受限。本文中,我们通过对考虑视觉对象与句子单词间判别性特征分布的高效学习目标来解决该局限。具体而言,我们提出一种新颖的对抗判别域正则化(ADDR)学习框架,超越范式度量学习目标,以在每对图像-文本内构建一组判别性数据域。我们的方法通过调节匹配对间隐空间分布,可普遍提升现有度量学习框架的学习效率与性能。实验结果表明,该新方法在 MS-COCO 和 Flickr30K 基准上显著改善了若干流行跨模态匹配技术(SCAN、VSRN、BFAN)的整体性能。

关键词

引用

@article{arxiv.2010.12126,
  title  = {Beyond the Deep Metric Learning: Enhance the Cross-Modal Matching with Adversarial Discriminative Domain Regularization},
  author = {Li Ren and Kai Li and LiQiang Wang and Kien Hua},
  journal= {arXiv preprint arXiv:2010.12126},
  year   = {2020}
}

备注

8 pages