中文

TACFN:基于 Transformer 的自适应跨模态融合网络用于多模态情感识别

计算机视觉与模式识别 2025-05-13 v1 人工智能

摘要

融合技术是多模态情感识别任务的关键。最近的基于跨模态注意力的融合方法表现出高性能和强鲁棒性。然而,跨模态注意力存在冗余特征且未能很好地捕获互补特征。我们发现,在跨模态交互期间,无需使用一个模态的整个信息来强化另一个模态,能够强化该模态的特征可能仅包含其中的一部分。为此,我们设计了一个创新的基于 Transformer 的自适应跨模态融合网络 (TACFN)。具体而言,对于冗余特征,我们使一个模态通过自注意力机制执行 intra-modal 特征选择,以便所选特征能够自适应且高效地与另一个模态进行交互。为更好地捕获两个模态之间的互补信息,我们获取融合权重向量通过拼接,并使用该权重向量实现模态的特征强化。我们将 TACFN 应用于 RAVDESS 和 IEMOCAP 数据集。为确保公平比较,我们使用相同的单模态表示来验证所提出融合方法的有效性。实验结果表明,TACFN 相比其他方法带来了显著的性能提升,并达到最新 state-of-the-art 水平。所有代码和模型可在 https://github.com/shuzihuaiyu/TACFN 获取。

关键词

引用

@article{arxiv.2505.06536,
  title  = {TACFN: Transformer-based Adaptive Cross-modal Fusion Network for Multimodal Emotion Recognition},
  author = {Feng Liu and Ziwang Fu and Yunlong Wang and Qijian Zheng},
  journal= {arXiv preprint arXiv:2505.06536},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2111.02172