中文

基于关键词的语义感知对比学习与 Transformer 的多样性图像检索

信息检索 2023-05-09 v1

摘要

除相关性外,多样性是跨模态图像检索系统一个重要却较少被研究的性能指标,其对用户体验至关重要。现有的多样性感知图像检索方案要么显式后处理标准检索系统的原始检索结果,要么尝试学习图像的多向量表示以表达其多样语义。然而,二者都不足以平衡相关性与多样性。一方面,标准检索系统通常偏向于常见语义,且在训练中很少利用多样性感知正则化,这使得通过后处理提升多样性变得困难。另一方面,多向量表示方法不能保证学习到鲁棒的多重投影。结果,无关图像以及具有稀有或独特语义的图像可能被不恰当地投影,从而降低了由 top-k 等典型算法所生成结果的相关性与多样性。为应对这些问题,本文提出一种称为 CoLT 的新方法,试图生成更具代表性与鲁棒性的表示以准确分类图像。具体而言,CoLT 首先通过用语义感知对比学习增强现有一对一跨模态系统的初步表示来提取语义感知图像特征。然后,开发一个基于 transformer 的 token 分类器将所有特征归入相应类别。最后,设计一种后处理算法从每个类别检索图像以形成最终检索结果。在 Div400 与 Div150Cred 两个真实数据集上的大量实验表明,CoLT 能有效提升多样性,并在整体上优于现有方法(具有更高的 F1 分数)。

关键词

引用

@article{arxiv.2305.04072,
  title  = {Keyword-Based Diverse Image Retrieval by Semantics-aware Contrastive Learning and Transformer},
  author = {Minyi Zhao and Jinpeng Wang and Dongliang Liao and Yiru Wang and Huanzhong Duan and Shuigeng Zhou},
  journal= {arXiv preprint arXiv:2305.04072},
  year   = {2023}
}

备注

Accepted by SIGIR2023 (long paper)