中文

基于多任务学习与动态特征融合的语音情感识别提升

声音 2025-08-26 v1

摘要

本研究探讨了使用多任务学习(MTL)对自监督学习(SSL)模型进行微调,以提高语音情感识别(SER)性能。该框架同时处理四个相关任务:情感识别、性别识别、说话人验证和自动语音识别。引入一种创新的共注意力模块,以动态捕获来自主要情感分类任务和辅助任务之间特征的相互作用,从而实现上下文感知的特征融合。此外,我们引入了样本加权焦点对比(SWFC)损失函数,以通过调整困难样本和少数样本的权重来解决类别不平衡和语义混淆问题。该方法在Speech Emotion Recognition in Naturalistic Conditions Challenge的情感识别任务上进行了验证,显示出显著的性能提升。

关键词

引用

@article{arxiv.2508.17878,
  title  = {Enhancing Speech Emotion Recognition with Multi-Task Learning and Dynamic Feature Fusion},
  author = {Honghong Wang and Jing Deng and Fanqin Meng and Rong Zheng},
  journal= {arXiv preprint arXiv:2508.17878},
  year   = {2025}
}

备注

accepted by interspeech2025