Wav2vec 2.0与BERT的多级融合用于多模态情感识别
计算与语言
2022-07-13 v2 声音
音频与语音处理
摘要
多模态情感识别的研究与应用近来日益流行。然而,多模态情感识别面临数据缺乏的挑战。为解决该问题,我们提出使用迁移学习,利用包括wav2vec 2.0和BERT在内的先进预训练模型来完成此任务。探索了多级融合方法,包括基于协同注意的早期融合以及使用两种嵌入训练的模型的晚期融合。此外,提出了一种多粒度框架,其不仅提取帧级语音嵌入,还提取包括音素、音节和词级语音嵌入的段级嵌入,以进一步提升性能。通过将我们基于协同注意的早期融合模型与晚期融合模型结合多粒度特征提取框架,我们在IEMOCAP数据集上取得了比最佳基线方法高1.3%非加权准确率(UA)的结果。
引用
@article{arxiv.2207.04697,
title = {Multi-level Fusion of Wav2vec 2.0 and BERT for Multimodal Emotion Recognition},
author = {Zihan Zhao and Yanfeng Wang and Yu Wang},
journal= {arXiv preprint arXiv:2207.04697},
year = {2022}
}
备注
Accepted to INTERSPEECH 2022