中文

EmoSphere-SER:通过球面表示与辅助分类增强语音情感识别

声音 2025-10-20 v2 人工智能 音频与语音处理

摘要

语音情感识别利用离散标签或连续维度(如唤醒度、效价和支配度(VAD))从语音信号中预测说话者的情感状态。我们提出了EmoSphere-SER,这是一个联合模型,集成了球面VAD区域分类以指导VAD回归,从而改进情感预测。在我们的框架中,VAD值被转换为球面坐标并划分为多个球面区域,辅助分类任务预测每个点所属的球面区域以指导回归过程。此外,我们引入了动态加权方案和带有自注意力的多头风格池化层,以捕捉频谱和时间动态,进一步提升性能。这种联合训练策略强化了结构化学习并提高了预测一致性。实验结果表明,我们的方法超越了基线方法,验证了所提框架的有效性。

关键词

引用

@article{arxiv.2505.19693,
  title  = {EmoSphere-SER: Enhancing Speech Emotion Recognition Through Spherical Representation with Auxiliary Classification},
  author = {Deok-Hyeon Cho and Hyung-Seok Oh and Seung-Bin Kim and Seong-Whan Lee},
  journal= {arXiv preprint arXiv:2505.19693},
  year   = {2025}
}

备注

Proceedings of Interspeech 2025