中文

学习最优多模态信息瓶颈表示

机器学习 2025-05-27 v1

摘要

利用来自多模态数据的高质量联合表示可以极大增强模型在各种基于机器学习的应用中的性能。基于多模态信息瓶颈(MIB)原理的近期多模态学习方法,旨在通过正则化生成具有最大任务相关信息和最少冗余信息的最优 MIB。然而,这些方法通常设定临时的正则化权重,并忽略了跨模态任务相关信息的不平衡性,限制了其实现最优 MIB 的能力。为了填补这一空白,我们提出了一种新颖的多模态学习框架,即最优多模态信息瓶颈(OMIB),其优化目标通过将正则化权重设定在理论推导的界限内,保证了实现最优 MIB 的可达性。OMIB 通过动态调整每个模态的正则化权重,进一步解决了任务相关信息不平衡的问题,促进了所有任务相关信息的包含。此外,我们为 OMIB 的优化建立了坚实的信息论基础,并在变分近似框架下实现了该框架以提高计算效率。最后,我们在合成数据上实证验证了 OMIB 的理论性质,并证明了其在各种下游任务中优于最先进基准方法的优越性。

关键词

引用

@article{arxiv.2505.19996,
  title  = {Learning Optimal Multimodal Information Bottleneck Representations},
  author = {Qilong Wu and Yiyang Shao and Jun Wang and Xiaobo Sun},
  journal= {arXiv preprint arXiv:2505.19996},
  year   = {2025}
}

备注

ICML 2025