中文

适应 WavLM 进行语音情感识别

机器学习 2024-05-08 v1 声音 音频与语音处理

摘要

最近, 利用语音自监督模型(SSL)进行下游任务的研究引起了广泛关注。虽然大型预训练模型通常优于从头训练的较小模型, 但关于最佳微调策略的疑问仍然存在。本文我们探索了在 MSP Podcast 数据集上进行语音情感识别任务时, 对 WavLM Large 模型的微调策略。具体而言, 我们进行了一系列实验, 聚焦于利用说话人性别和语义信息。随后我们总结了发现并描述了用于提交至 2024 年语音情感识别挑战赛的最终模型。

关键词

引用

@article{arxiv.2405.04485,
  title  = {Adapting WavLM for Speech Emotion Recognition},
  author = {Daria Diatlova and Anton Udalov and Vitalii Shutov and Egor Spirin},
  journal= {arXiv preprint arXiv:2405.04485},
  year   = {2024}
}