中文

基于分布一致性学习的图像-文本匹配统计视角方法

计算机视觉与模式识别 2024-05-21 v1 信息检索

摘要

图像-文本匹配长期以来是一大难题,旨在通过语义理解建立视觉与语言之间的联系。由于其处理大规模原始数据的能力,基于无监督哈希的方法近日受到关注。这些方法通常利用自然距离构建语义相似性结构,从而为模型优化提供指导。然而,语义分布边界处的相似性结构可能受偏差,导致顺序优化中误差累积。为此,我们提出一种新颖的哈希方法,称为分布基结构挖掘与一致性学习 (DEMO),用于高效图像-文本匹配。从统计视角看,DEMO 将每个图像表征为多个增强视图,视为从其内在语义分布中抽取的样本。随后采用非参数分布散度确保稳健且精确的相似性结构。此外,我们引入协同一致性学习,不仅在汉明空间保留相似性结构,还鼓励来自不同方向的检索分布在自监督方式下的一致性。通过在三个基准图像-文本匹配数据集上进行大量实验,我们展示 DEMO 在众多最先进方法之上取得优异性能。

关键词

引用

@article{arxiv.2405.11496,
  title  = {DEMO: A Statistical Perspective for Efficient Image-Text Matching},
  author = {Fan Zhang and Xian-Sheng Hua and Chong Chen and Xiao Luo},
  journal= {arXiv preprint arXiv:2405.11496},
  year   = {2024}
}