中文

基于深度神经网络的波斯语语音情感识别

声音 2022-11-15 v2 人工智能 音频与语音处理

摘要

语音情感识别(SER)在人机交互(HCI)中具有重要意义,因为它提供对情境的更深理解并带来更好的交互。近年来,各种机器学习和深度学习(DL)算法被开发以改进 SER 技术。口语情感的识别依赖于在不同语言间变化的表达类型。本文为进一步研究波斯语中的重要因素,在一个波斯语/波斯语数据集 Sharif Emotional Speech Database(ShEMO,2018 年发布)上检验多种 DL 技术。利用低层与高层描述中的信号特征以及不同深度神经网络和机器学习技术,取得了 65.20% 的非加权准确率(UA)和 78.29% 的加权准确率(WA)。

关键词

引用

@article{arxiv.2204.13601,
  title  = {Emotion Recognition In Persian Speech Using Deep Neural Networks},
  author = {Ali Yazdani and Hossein Simchi and Yasser Shekofteh},
  journal= {arXiv preprint arXiv:2204.13601},
  year   = {2022}
}

备注

5 pages, 1 figure, 3 tables