中文

耦合 Mamba:基于耦合状态空间模型的增强多模态融合

人工智能 2025-06-19 v2

摘要

多模态融合的本质在于利用不同模态中固有的互补信息。然而,流行的融合方法依赖于传统神经网络结构,难以捕捉复杂的内部和跨模态相关性下的模态间相互作用的动态。近期出现的状态空间模型(SSMs),尤其是以 Mamba 模型为代表,正成为值得期待的 contender。特别是,其状态演化过程暗示了更强的模态融合范式,使多模态融合于 SSMs 成为引人注目的方向。然而,由于其硬件感知并行设计,融合多个模态对 SSMs 来说具有挑战性。为此,本文提出了耦合 SSM 模型,用于在保持内部模态状态过程独立性的同时,将多个模态的状态链进行耦合。具体而言,在我们的耦合方案中,我们设计了一种跨模态隐藏状态转换方案,其中当前状态取决于其自身链和相邻链在前一时间步的状态。为完全符合硬件感知并行,我们设计了一种加速耦合状态转换方案,并推导其对应的全局卷积核以实现并行。通过在 CMU-MOSEI、CH-SIMS、CH-SIMSV2 上的多域输入进行大量实验验证,我们的方法在当前最先进方法中具有有效性,在三个数据集上分别提高了 0.4%、0.9% 和 2.3% 的 F1 分数,推理速度提高了 49%,GPU 内存节省 83.7%。结果表明,耦合 Mamba 模型能够实现增强的多模态融合。

关键词

引用

@article{arxiv.2405.18014,
  title  = {Coupled Mamba: Enhanced Multi-modal Fusion with Coupled State Space Model},
  author = {Wenbing Li and Hang Zhou and Junqing Yu and Zikai Song and Wei Yang},
  journal= {arXiv preprint arXiv:2405.18014},
  year   = {2025}
}