中文

基于监督对比学习的跨语料音调情感识别方法

声音 2024-12-02 v1 计算与语言 音频与语音处理

摘要

音调情感识别(SER)研究常面临数据集规模不足以及在不同分布数据上泛化能力有限的挑战。为解决此问题,本文提出一种基于监督对比学习的跨语料音调情感识别方法。该方法采用两个阶段的微调过程:首先,在多个音调情感数据集上使用监督对比学习对自监督语音表示模型进行微调;随后,在目标数据集上对分类器进行微调。实验结果表明,基于 WavLM 的模型在 IEMOCAP 数据集上实现了 77.41% 的 unweighted accuracy(UA),在 CASIA 数据集上实现了 96.49%,显著优于该两个数据集上的现有最先进结果。

关键词

引用

@article{arxiv.2411.19803,
  title  = {A Cross-Corpus Speech Emotion Recognition Method Based on Supervised Contrastive Learning},
  author = {Xiang minjie},
  journal= {arXiv preprint arXiv:2411.19803},
  year   = {2024}
}