中文

面向多模态表示学习的统一性与对齐

计算机视觉与模式识别 2026-04-02 v3

摘要

多模态表示学习旨在构建共享嵌入空间,以实现异构模态的语义对齐。尽管存在强大的经验结果,基于InfoNCE的目标在多模态情境下引入内在冲突,导致模态间存在分布差距。本文识别了两种在多模态情境下的冲突,这两种冲突随着模态数量的增加而加剧:(i)对齐-均匀性冲突,即均匀性的排斥会削弱两两对齐;(ii)内对齐冲突,即对齐多个模态会引发竞争性的对齐方向。为此,我们提出了一种对多模态表示进行原则性解耦的对齐与均匀性的方法,为多模态学习提供一种无冲突的配方,能够无需任务特定模块地同时支持判别式和生成式用例。我们进一步提供了理论保证,表明我们的方法是对多个模态分布全局Hölder散度的高效近似值,从而减少模态间的分布差距。大量实验在检索和UnCLIP式生成上均显示出一致的提升。

关键词

引用

@article{arxiv.2602.09506,
  title  = {Equilibrium contrastive learning for imbalanced image classification},
  author = {Sumin Roh and Harim Kim and Ho Yun Lee and Il Yong Chun},
  journal= {arXiv preprint arXiv:2602.09506},
  year   = {2026}
}

备注

18 pages, 8 figures