中文

深度平衡多模态融合

计算机视觉与模式识别 2023-06-30 v1 多媒体

摘要

多模态融合整合多种模态中存在的互补信息,近年来受到广泛关注。大多数现有融合方法要么在训练和推理期间学习固定的融合策略,要么只能在一定程度上融合信息。当需要考虑复杂的模态内与模态间相关性以实现信息丰富的多模态融合时,此类方案可能无法充分捕捉跨模态交互的动态特性。本文提出一种新颖的深度平衡(DEQ)方法用于多模态融合,通过寻求动态多模态融合过程的固定点,并以自适应和递归的方式对特征相关性进行建模。这一新方式从低层到高层彻底编码模态内与模态间的丰富信息,以实现有效的下游多模态学习,并可即插即用到各种多模态框架中。在BRCA、MM-IMDB、CMU-MOSI、SUN RGB-D和VQA-v2上的大量实验证明了我们DEQ融合的优越性。更值得注意的是,DEQ融合在多个多模态基准上持续取得最先进(SOTA)性能。代码将公开。

关键词

引用

@article{arxiv.2306.16645,
  title  = {Deep Equilibrium Multimodal Fusion},
  author = {Jinhong Ni and Yalong Bai and Wei Zhang and Ting Yao and Tao Mei},
  journal= {arXiv preprint arXiv:2306.16645},
  year   = {2023}
}