中文

用于文本到图像匹配的对抗表示学习

计算机视觉与模式识别 2019-08-29 v1

摘要

对于许多计算机视觉应用(如图像描述、视觉问答和行人搜索),在图像和文本层面学习判别性特征表示是一个至关重要且具有挑战性的问题。其挑战源于文本域中巨大的词方差,以及精确测量两种模态特征之间距离的困难。大多数先前的工作集中于后一个挑战,通过引入帮助网络学习更好特征表示的损失函数,但未能考虑文本输入的复杂性。考虑到这一点,我们引入了 TIMAM:一种文本-图像模态对抗匹配方法,该方法利用对抗和跨模态匹配目标来学习模态不变特征表示。此外,我们证明了 BERT(一种提取词嵌入的公开可用语言模型)可以成功应用于文本到图像匹配领域。所提出的方法在四个广泛使用的公开可用数据集上实现了最先进的跨模态匹配性能,在 rank-1 准确率方面取得了 2% 到 5% 的绝对提升。

关键词

引用

@article{arxiv.1908.10534,
  title  = {Adversarial Representation Learning for Text-to-Image Matching},
  author = {Nikolaos Sarafianos and Xiang Xu and Ioannis A. Kakadiaris},
  journal= {arXiv preprint arXiv:1908.10534},
  year   = {2019}
}

备注

To appear in ICCV 2019