中文

(盲目)匹配!面向无平行数据的视觉-语言对应性研究

计算机视觉与模式识别 2025-05-30 v2 机器学习

摘要

完美化表示假设指出,随着模型和数据集规模的增加,视觉和语言嵌入将变得更加均匀,特别是同一模态内的成对距离变得更相似。这表明随着基础模型的成熟,可能在完全无监督的情况下匹配视觉和语言嵌入,即无需平行数据。我们present首个可行性研究,探讨在无监督或“盲目”匹配语境下现有视觉和语言基础模型的一致性。首先,我们将无监督匹配形式化为二次分配问题,并引入一种新颖的启发式方法,超越了之前的求解器。我们还开发了一种寻找最优匹配问题的方法,其中非平凡匹配的可能性很大。其次,我们在四个数据集上部署了多种视觉和语言模型。我们的分析揭示了对于许多问题实例,视觉和语言表示确实可以在无监督的情况下进行匹配。这一发现开辔了将语义知识几乎无需注释嵌入到其他模态的激动人心的可能性。作为可行性证明,我们展示了一个无监督分类器,在没有任何图像-文本注释的情况下仍实现了非平凡的分类准确率。

关键词

引用

@article{arxiv.2503.24129,
  title  = {It's a (Blind) Match! Towards Vision-Language Correspondence without Parallel Data},
  author = {Dominik Schnaus and Nikita Araslanov and Daniel Cremers},
  journal= {arXiv preprint arXiv:2503.24129},
  year   = {2025}
}

备注

Accepted to CVPR 2025, Project page: https://dominik-schnaus.github.io/itsamatch/