中文

一种基于低秩匹配注意力的跨模态特征融合方法用于对话情绪识别

计算机视觉与模式识别 2024-11-18 v2 声音 音频与语音处理

摘要

对话情绪识别(CER)是人机交互中的重要研究课题。{尽管近期基于 transformer 的跨模态融合方法在 CER 任务中展现出前景,但它们往往忽视关键的模态内与模态间情绪交互,或饱受高计算复杂度之苦。为此,我们引入一种新颖且轻量的跨模态特征融合方法,称为低秩匹配注意力方法(LMAM)。LMAM 在有效捕获对话中上下文情绪语义信息的同时,缓解了自注意力机制引发的二次复杂度问题。具体而言,通过设置匹配权重并逐行计算模态间特征注意力分数,LMAM 仅需自注意力方法三分之一的参数。我们还在权重上采用低秩分解方法以进一步减少 LMAM 的参数数量。因此,LMAM 提供了一种轻量模型,同时避免了由大量参数引起的过拟合问题。此外,LMAM 能够充分利用各模态内的模态内情绪上下文信息,并通过同时计算与融合模态内与模态间特征的相似性来整合跨模态的互补情绪语义信息。实验结果验证了 LMAM 在其他流行跨模态融合方法基础上、在更轻量的前提下具有优越性。同时,LMAM 能以即插即用的方式嵌入任意现有 SOTA CER 方法中,并可应用于其他多模态识别任务,如会话推荐与幽默检测,展现出显著的泛化能力。

关键词

引用

@article{arxiv.2306.17799,
  title  = {A Low-rank Matching Attention based Cross-modal Feature Fusion Method for Conversational Emotion Recognition},
  author = {Yuntao Shou and Huan Liu and Xiangyong Cao and Deyu Meng and Bo Dong},
  journal= {arXiv preprint arXiv:2306.17799},
  year   = {2024}
}

备注

13 pages, 5 figures