中文

LMR-CBT:利用CB-Transformer学习模态融合表示以处理未对齐多模态序列的多模态情感识别

计算机视觉与模式识别 2021-12-06 v1 计算与语言 机器学习 声音 音频与语音处理

摘要

学习模态融合表示并处理未对齐多模态序列在多模态情感识别中具有重要意义且富有挑战性。现有方法使用有向成对注意力或消息枢纽来融合语言、视觉与音频模态。然而,这些方法在融合特征时引入了信息冗余,且未考虑模态互补性,效率低下。本文提出一种高效神经网络,利用CB-Transformer学习模态融合表示(LMR-CBT),用于从未对齐多模态序列中进行多模态情感识别。具体而言,我们首先对三种模态分别进行特征提取以获得序列的局部结构。随后,我们设计了一种带跨模态块的新颖transformer(CB-Transformer),可实现不同模态的互补学习,主要分为局部时序学习、跨模态特征融合与全局自注意力表示。此外,我们将融合特征与原始特征拼接以对序列情感进行分类。最后,我们在三个具挑战性的数据集IEMOCAP、CMU-MOSI与CMU-MOSEI上进行了词对齐与未对齐实验。实验结果表明所提方法在两种设定下的优越性与高效性。相比主流方法,我们的方法以最少参数量达到了state-of-the-art。

关键词

引用

@article{arxiv.2112.01697,
  title  = {LMR-CBT: Learning Modality-fused Representations with CB-Transformer for Multimodal Emotion Recognition from Unaligned Multimodal Sequences},
  author = {Ziwang Fu and Feng Liu and Hanyang Wang and Siyuan Shen and Jiahao Zhang and Jiayin Qi and Xiangling Fu and Aimin Zhou},
  journal= {arXiv preprint arXiv:2112.01697},
  year   = {2021}
}

备注

9 pages ,Figure 2, Table 5