中文

一张图像值得五句话吗?图像-文本匹配语义的新审视

计算机视觉与模式识别 2021-10-07 v1 人工智能

摘要

图像-文本匹配任务旨在将不同模态的表示映射到一个共同的视觉-文本联合嵌入空间中。然而,该任务最广泛使用的数据集 MSCOCO 和 Flickr30K 实际上是图像描述数据集,在其真值标注中仅提供图像与句子之间非常有限的关系集合。这种有限的真值信息迫使我们采用基于二元相关性的评价指标:给定一个句子查询,我们仅将一张图像视为相关。然而,数据集中可能存在许多其他相关图像或描述。在本工作中,我们提出两个评价指标,用于评估检索项的语义相关程度,与其标注的二元相关性无关。此外,我们引入一种新策略,利用图像描述指标 CIDEr 来定义语义自适应边界(Semantic Adaptive Margin, SAM),以在标准三元组损失中进行优化。通过将我们的公式融入现有模型,在可用训练数据有限的场景下获得了显著提升。我们还证明,在使用完整训练集时,标注的图像-描述对上的性能得以保持,同时其他未标注的相关项上的性能得到改善。我们的评价指标与自适应边界公式的代码将公开。

关键词

引用

@article{arxiv.2110.02623,
  title  = {Is An Image Worth Five Sentences? A New Look into Semantics for Image-Text Matching},
  author = {Ali Furkan Biten and Andres Mafla and Lluis Gomez and Dimosthenis Karatzas},
  journal= {arXiv preprint arXiv:2110.02623},
  year   = {2021}
}

备注

Accepted WACV 2022