多模态对比表示学习的标准化
机器学习
2026-02-20 v1
摘要
随着模型和数据的规模不断增长,独立训练的网络往往会诱导出类似的相似性概念。但匹配相似性比在表示空间中建立明确对应关系要弱得多,尤其是对于多模态模型,一致性必须不仅在每个模态内部成立,也要对于所学图像-文本耦合成立。因此,我们提出:给定两个独立训练的多模态对比模型(具有编码器和),分别在不同的分布和不同的体系结构下训练,是否存在其嵌入空间之间的系统几何关系?如果存在,这种关系的形式是什么?它是否在所有模态上都一致?本文中,我们展示了在诸如CLIP、SigLIP和FLAVA等模型族中,这种几何关系被良好近似为正交映射(加上全局均值偏移),即存在正交矩阵使得,从而满足对于配对图像。令人惊讶的是,相同的同时也能对齐文本编码器,即对于文本。理论上,我们证明了如果多模态核在小锚定集合上的匹配性,即,那么这两个模型必须由单个正交映射来关系,且相同的映射图像和文本跨模型。更广泛地说,这一发现使模型升级能够向后兼容,避免了重新嵌入的高额成本,并对所学表示的隐私具有启示。我们的项目页面:https://canonical-multimodal.github.io/
引用
@article{arxiv.2602.17584,
title = {Canonicalizing Multimodal Contrastive Representation Learning},
author = {Sharut Gupta and Sanyam Kansal and Stefanie Jegelka and Phillip Isola and Vikas Garg},
journal= {arXiv preprint arXiv:2602.17584},
year = {2026}
}
备注
78 pages, 57 figures