中文

在多模态情感识别中利用辅助任务融合 Wav2vec 2.0 与 BERT

计算与语言 2023-02-28 v1 声音 音频与语音处理

摘要

数据匮乏与多模态融合的困难一直是多模态情感识别(MER)面临的挑战。本文中,我们提出使用预训练模型作为上游网络——音频模态使用 wav2vec 2.0,文本模态使用 BERT——并在 MER 下游任务中对其进行微调,以应对数据匮乏问题。针对多模态融合的困难,我们采用 K 层多头注意力机制作为下游融合模块。从 MER 任务本身出发,我们设计两个辅助任务以缓解模态间融合不足,并引导网络捕获和对齐与情感相关的特征。相较于先前最先进(SOTA)模型,我们在 IEMOCAP 数据集上以 78.42% 加权准确率(WA)和 79.71% 非加权准确率(UA)取得了更优性能。

关键词

引用

@article{arxiv.2302.13661,
  title  = {Using Auxiliary Tasks In Multimodal Fusion Of Wav2vec 2.0 And BERT For Multimodal Emotion Recognition},
  author = {Dekai Sun and Yancheng He and Jiqing Han},
  journal= {arXiv preprint arXiv:2302.13661},
  year   = {2023}
}