中文

面向最优相似度度量的加权点集嵌入:多模态对比学习

机器学习 2025-03-04 v3

摘要

在典型的多模态对比学习中,如CLIP,编码器为每个输入在潜在表示空间中产生一个点。然而,单点表示在捕捉大量实例在现实世界中的关系和相似性结构方面存在困难。为了实现更丰富的相似性类别,我们提出使用加权点集,即由权重与向量对的集合,作为实例的表示。在本工作中,我们通过一种新的对CLIP对比损失的理解(称为对称InfoNCE)来理论证明我们所提出方法的优势。我们阐明了最小化对称InfoNCE的最优相似性是点互信息,并且展示了实现最优相似性的表示在下游分类任务中的风险上限。此外,我们表明我们基于加权点集的相似性始终能够实现最优相似性。为验证我们所提出方法的有效性,我们演示了文本-图像表示模型和常见基准上的分类任务的预训练。

关键词

引用

@article{arxiv.2404.19228,
  title  = {Weighted Point Set Embedding for Multimodal Contrastive Learning Toward Optimal Similarity Metric},
  author = {Toshimitsu Uesaka and Taiji Suzuki and Yuhta Takida and Chieh-Hsin Lai and Naoki Murata and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2404.19228},
  year   = {2025}
}

备注

ICLR 2025 (Spotlight)