在多模态情感识别中利用辅助任务融合 Wav2vec 2.0 与 BERT
计算与语言
2023-02-28 v1 声音
音频与语音处理
摘要
数据匮乏与多模态融合的困难一直是多模态情感识别(MER)面临的挑战。本文中,我们提出使用预训练模型作为上游网络——音频模态使用 wav2vec 2.0,文本模态使用 BERT——并在 MER 下游任务中对其进行微调,以应对数据匮乏问题。针对多模态融合的困难,我们采用 K 层多头注意力机制作为下游融合模块。从 MER 任务本身出发,我们设计两个辅助任务以缓解模态间融合不足,并引导网络捕获和对齐与情感相关的特征。相较于先前最先进(SOTA)模型,我们在 IEMOCAP 数据集上以 78.42% 加权准确率(WA)和 79.71% 非加权准确率(UA)取得了更优性能。
引用
@article{arxiv.2302.13661,
title = {Using Auxiliary Tasks In Multimodal Fusion Of Wav2vec 2.0 And BERT For Multimodal Emotion Recognition},
author = {Dekai Sun and Yancheng He and Jiqing Han},
journal= {arXiv preprint arXiv:2302.13661},
year = {2023}
}