中文

OVA-IB:多模态对齐的One vs All信息瓶颈

机器学习 2026-05-29 v1 信息论 math.IT

摘要

对比学习对于对齐两个模态的观察或模态非常有效,但超出两个模态的对齐仍然具有挑战性且相对较少探索。两两CLIP风格的损失将多模态对齐分解为独立的双向比较,因此不显式地建模多个模态之间的高阶依赖关系。最近的超两两目标方法从统计或几何学角度解决此问题,但对于任意模态的对齐仍缺乏原则性的标准来定义每个模态应相对于其他模态保留和压缩什么信息。我们通过信息瓶颈原理重新审视任意模态的对齐。在多模态学习中,充分性应保留从其他模态可预测的剩余信息,而最小性应压缩由其他模态不支持的模态特定信息。这自然导致一种以剩余模态为参照的单模态视图,其中每个模态相对于剩余模态进行特征描述。我们提出OVA-IB,一个用于任意模态对齐的信息瓶颈框架。OVA-IB优化了一个与Dual Total Correlation风格目标相关的可计算的单vs所有对比下界,用于充分性,采用参数自由的几何感知投影得分,并通过对每个表示的输入分布进行上界来推导最小性的可计算上界正则化器。在分类、回归、模态无关评估和跨模态检索基准测试中,实验显示出色且稳健的性能。

关键词

引用

@article{arxiv.2605.29900,
  title  = {OVA-IB: One vs All Information Bottleneck for Multi-Modal Alignment},
  author = {Tianchao Li and Shujian Yu and Xinrui Zu and Zhaolong Wei and Jeremy Gummeson and Jack C. P. Cheng and Robert Jenssen},
  journal= {arXiv preprint arXiv:2605.29900},
  year   = {2026}
}