联合微调“类 BERT”自监督模型以改进多模态语音情感识别
音频与语音处理
2024-10-08 v1 人工智能
计算与语言
声音
摘要
基于语音的多模态情感识别是情感计算中的重要领域。融合多种数据模态并在有限标注数据下学习表征是一项具有挑战性的任务。本文中,我们探索使用模态特定的“类 BERT”预训练自监督学习(SSL)架构来表示语音与文本模态,用于多模态语音情感识别任务。通过在三个公开可用数据集(IEMOCAP、CMU-MOSEI 和 CMU-MOSI)上开展实验,我们表明联合微调“类 BERT”SSL 架构取得了最先进(SOTA)结果。我们还评估了两种融合语音与文本模态的方法,并表明当使用具有与 BERT 相似架构属性的 SSL 模型时,简单融合机制可优于更复杂的融合机制。
引用
@article{arxiv.2008.06682,
title = {Jointly Fine-Tuning "BERT-like" Self Supervised Models to Improve Multimodal Speech Emotion Recognition},
author = {Shamane Siriwardhana and Andrew Reis and Rivindu Weerasekera and Suranga Nanayakkara},
journal= {arXiv preprint arXiv:2008.06682},
year = {2024}
}
备注
Accepted to INTERSPEECH 2020