中文

无监督表征提升语音情感识别中的监督学习

音频与语音处理 2023-09-25 v1 机器学习 声音

摘要

语音情感识别(SER)通过实现对广泛应用中情感状态的更深入理解,在增强人机交互方面发挥着关键作用,有助于更具共情力与成效的沟通。本研究提出一种创新方法,将自监督特征提取与监督分类相结合,用于从小型音频片段中识别情感。在预处理步骤中,为免去手工设计音频特征的需要,我们采用基于Wav2Vec模型的自监督特征提取器从音频数据中捕获声学特征。随后,预处理步骤输出的特征图被送入定制的基于卷积神经网络(CNN)的模型以执行情感分类。利用ShEMO数据集作为测试基准,所提方法超越了两种基线方法,即支持向量机分类器与预训练CNN的迁移学习。将所提方法与SER任务中的SOTA方法比较表明了其优越性。我们的发现凸显了深度无监督特征学习在提升SER图景中的关键作用,为人机交互领域的情感理解提供了增强。

关键词

引用

@article{arxiv.2309.12714,
  title  = {Unsupervised Representations Improve Supervised Learning in Speech Emotion Recognition},
  author = {Amirali Soltani Tehrani and Niloufar Faridani and Ramin Toosi},
  journal= {arXiv preprint arXiv:2309.12714},
  year   = {2023}
}