中文

基于预训练语音编码器的个性化自适应方法用于连续情感识别

音频与语音处理 2023-09-06 v1 声音 信号处理

摘要

由文化规范和个性驱动的表达行为存在个体差异。这种人际差异会导致情感识别性能下降。因此,个性化是提升语音情感识别泛化能力和鲁棒性的重要步骤。本文中,为实现无监督个性化情感识别,我们首先以自监督方式预训练一个带有可学习说话人嵌入的编码器,以学习基于说话人的鲁棒语音表征。其次,我们提出一种无监督方法,通过寻找相似说话人并利用其在训练集中的标签分布来补偿标签分布偏移。在 MSP-Podcast 语料库上的大量实验结果表明,我们的方法持续优于强个性化基线,并在效价估计上达到最先进的性能。

关键词

引用

@article{arxiv.2309.02418,
  title  = {Personalized Adaptation with Pre-trained Speech Encoders for Continuous Emotion Recognition},
  author = {Minh Tran and Yufeng Yin and Mohammad Soleymani},
  journal= {arXiv preprint arXiv:2309.02418},
  year   = {2023}
}

备注

Accepted by INTERSPEECH 2023