中文

通过 1-to-K 对比学习提高跨语言跨模态检索一致性

信息检索 2024-06-27 v1 人工智能 多媒体

摘要

跨语言跨模态检索(Cross-lingual Cross-modal Retrieval, CCR)是网络搜索中的重要任务,旨在同时突破语言和模态之间的障碍,并以单一模型实现多语言场景下的图像-文本检索。近年来,基于跨语言跨模态预训练的方法取得了显著进展,特别是基于大规模数据的对比学习方法在检索任务中取得了显著提升。然而,这些方法直接沿用了跨语言或跨模态领域的现有预训练方法,导致CCR中存在两个一致性问题:采用跨语言风格的方法会产生模态内部误差传播,导致整个数据集中不同语言的召回性能不一致;采用跨模态风格的方法会产生模态间优化方向偏差,导致每个实例中不同语言的排名不一致,这种现象无法通过Recall@K得以反映。为解决这些问题,我们提出了一种简单而有效的1-to-K对比学习方法,该方法在每个语言上平等对待,消除误差传播和优化偏差。此外,我们提出了一种新的评估指标——平均排名方差(Mean Rank Variance, MRV),以反映每个实例中不同语言的排名不一致性。在四个CCR数据集上的大量实验表明,我们的方法在使用较小规模预训练数据的情况下,显著提升了召回率和MRV,达到了新的状态最佳成绩。

关键词

引用

@article{arxiv.2406.18254,
  title  = {Improving the Consistency in Cross-Lingual Cross-Modal Retrieval with 1-to-K Contrastive Learning},
  author = {Zhijie Nie and Richong Zhang and Zhangchi Feng and Hailang Huang and Xudong Liu},
  journal= {arXiv preprint arXiv:2406.18254},
  year   = {2024}
}

备注

Accepted by KDD 2024 Research Track