中文

跨模态系统是否利用了语义关系?

计算机视觉与模式识别 2019-09-06 v1

摘要

当前的跨模态检索系统使用 R@K 指标进行评估,该指标不利用语义关系,而是严格遵循人工标注的图像-文本查询对。因此,当前系统对于真实场景中未见过的数据泛化能力不佳。为此,我们提出一种新的度量 SemanticMap 来评估跨模态系统的性能。我们提出的度量评估潜在嵌入空间中图像与文本表示之间的语义相似度。我们还提出了一种使用单流网络进行双向检索的新颖跨模态检索系统。所提系统基于使用扩展中心损失训练的深层神经网络,使潜在空间中图像和文本描述与类中心的距离最小化。在我们的系统中,文本描述也被编码为图像,这使我们能够对文本和图像使用单流网络。据我们所知,我们的工作在采用单流网络用于跨模态检索系统方面属于首创。所提系统在包括 MSCOCO 和 Flickr30K 在内的两个公开数据集上进行了评估,并展现出与当前最先进(SOTA)方法相当的结果。

关键词

引用

@article{arxiv.1909.01976,
  title  = {Do Cross Modal Systems Leverage Semantic Relationships?},
  author = {Shah Nawaz and Muhammad Kamran Janjua and Ignazio Gallo and Arif Mahmood and Alessandro Calefati and Faisal Shafait},
  journal= {arXiv preprint arXiv:1909.01976},
  year   = {2019}
}

备注

Accepted to cross modal learning in real world in conjunction with ICCV 2019. arXiv admin note: text overlap with arXiv:1807.07364