中文

多模态对比表示学习的标准化

机器学习 2026-02-20 v1

摘要

随着模型和数据的规模不断增长,独立训练的网络往往会诱导出类似的相似性概念。但匹配相似性比在表示空间中建立明确对应关系要弱得多,尤其是对于多模态模型,一致性必须不仅在每个模态内部成立,也要对于所学图像-文本耦合成立。因此,我们提出:给定两个独立训练的多模态对比模型(具有编码器(f,g)(f, g)(f~,g~)(\widetilde{f},\widetilde{g})),分别在不同的分布和不同的体系结构下训练,是否存在其嵌入空间之间的系统几何关系?如果存在,这种关系的形式是什么?它是否在所有模态上都一致?本文中,我们展示了在诸如CLIP、SigLIP和FLAVA等模型族中,这种几何关系被良好近似为正交映射(加上全局均值偏移),即存在正交矩阵QQ使得QQ=IQ^\top Q = I,从而满足f~(x)Qf(x)\widetilde{f}(x)\approx Q f(x)对于配对图像xx。令人惊讶的是,相同的QQ同时也能对齐文本编码器,即g~(y)Qg(y)\widetilde{g}(y)\approx Q g(y)对于文本yy。理论上,我们证明了如果多模态核在小锚定集合上的匹配性,即f(x),g(y)f~(x),g~(y)\langle f(x), g(y)\rangle \approx \langle \widetilde{f}(x), \widetilde{g}(y)\rangle,那么这两个模型必须由单个正交映射QQ来关系,且相同的QQ映射图像和文本跨模型。更广泛地说,这一发现使模型升级能够向后兼容,避免了重新嵌入的高额成本,并对所学表示的隐私具有启示。我们的项目页面:https://canonical-multimodal.github.io/

关键词

引用

@article{arxiv.2602.17584,
  title  = {Canonicalizing Multimodal Contrastive Representation Learning},
  author = {Sharut Gupta and Sanyam Kansal and Stefanie Jegelka and Phillip Isola and Vikas Garg},
  journal= {arXiv preprint arXiv:2602.17584},
  year   = {2026}
}

备注

78 pages, 57 figures