中文

将列表排序集成到基于成对的图像-文本检索中

计算机视觉与模式识别 2023-05-29 v1

摘要

图像-文本检索(ITR)本质上是一个排序问题。给定查询描述,目标是对候选图像按相关性从大到小排序。当前的ITR数据集以成对方式构建,图像-文本对被标注为正或负。相应地,ITR模型主要使用成对损失(如三元组损失)来学习排序。基于成对的ITR无差别地增加正样本对相似度同时降低负样本对相似度。然而,不相似负样本对之间的相关性是不同的。成对标注无法反映这种相关性差异。在当前数据集中,成对标注遗漏了许多关联,被标为负样本的对中存在许多潜在正样本对。基于成对的ITR只能将正样本排在负样本之前,而无法按相关性对负样本排序。本文中,我们将列表排序集成到传统的基于成对的ITR中。列表排序基于相关性分数优化整个排序列表。具体而言,我们首先提出一个相关性分数计算(RSC)模块来计算整个排序列表的相关性分数。然后我们选择排序度量归一化折损累计增益(NDCG)作为优化目标。我们将不可微的NDCG转化为可微的列表损失,称为Smooth-NDCG(S-NDCG)。我们的列表排序方法可即插即用地集成到当前基于成对的ITR模型中。在ITR基准上的实验表明,集成列表排序能提升当前ITR模型性能并提供更友好的检索结果。代码见https://github.com/AAA-Zheng/Listwise_ITR。

关键词

引用

@article{arxiv.2305.16566,
  title  = {Integrating Listwise Ranking into Pairwise-based Image-Text Retrieval},
  author = {Zheng Li and Caili Guo and Xin Wang and Zerun Feng and Yanjun Wang},
  journal= {arXiv preprint arXiv:2305.16566},
  year   = {2023}
}