中文

保持语义邻域的鲁棒跨模态检索

计算机视觉与模式识别 2020-09-24 v1 计算与语言 信息检索 机器学习

摘要

多模态数据(如社交媒体帖子)的丰富性激发了人们对跨模态检索方法的兴趣。流行的方法依赖多种度量学习损失,这些损失规定了在所学空间中图像与文本的邻近程度应当如何。然而,大多数先前方法聚焦于图像与文本传达冗余信息的情况;相比之下,真实世界的图像-文本对传达的是重叠极少的互补信息。此外,新闻文章与媒体中的图像以视觉上多样的方式描绘主题;因此,我们需要特别留意以确保有意义的图像表示。我们提出了新颖的模态内损失,其在文本与图像子空间中鼓励语义连贯性,而这未必与视觉连贯性一致。我们的方法不仅确保配对的图像与文本接近,还确保预期的图像-图像与文本-文本关系得以保持。我们的方法在四个数据集上相较五种基线改善了跨模态检索的结果。

关键词

引用

@article{arxiv.2007.08617,
  title  = {Preserving Semantic Neighborhoods for Robust Cross-modal Retrieval},
  author = {Christopher Thomas and Adriana Kovashka},
  journal= {arXiv preprint arXiv:2007.08617},
  year   = {2020}
}