中文

更多即更好:对更高阶多模态对齐的对比融合

计算机视觉与模式识别 2026-04-06 v2 人工智能

摘要

在多模态机器学习中,跨多个模态学习联合表征仍是核心挑战。现有方法主要在两两(pairwise)设置下工作,即一次对齐两个模态。虽然有些近期方法试图捕获多个模态之间的更高阶相互作用,但往往忽视或未充分保留两两关系,这限制了其在单模态任务中的效果。本文引入对比融合(Contrastive Fusion, 简称 ConFu),是一个框架,能够将单个模态及其融合组合嵌入统一的表征空间,其中模态与其融合后的表征被对齐。ConFu 将传统的两两对比目标扩展为额外的融合模态对比项,鼓励第三个模态与模态对之间的联合嵌入。这种表述使 ConFu 能够捕获无法通过两两对齐恢复的更高阶依赖关系,如类 XOR 关系,同时仍保持强大的两两对应关系。我们在合成数据和真实世界的多模态基准测试上评估 ConFu,评估其利用跨模态互补性、捕获更高阶依赖关系以及随多模态复杂度提升的扩展能力。在这些场景下,ConFu 在检索和分类任务上表现出竞争力,同时支持在单一对比框架内实现统一的一对一和二对一检索。我们在 https://github.com/estafons/confu 上发布了代码和数据集。

关键词

引用

@article{arxiv.2511.21331,
  title  = {The More, the Merrier: Contrastive Fusion for Higher-Order Multimodal Alignment},
  author = {Stefanos Koutoupis and Michaela Areti Zervou and Konstantinos Kontras and Maarten De Vos and Panagiotis Tsakalides and Grigorios Tsagkatakis},
  journal= {arXiv preprint arXiv:2511.21331},
  year   = {2026}
}

备注

Accepted to CVPR 2026