用深度学习框架评估原始波形用于语音情感识别
声音
2023-07-07 v1 人工智能
音频与语音处理
摘要
语音情感识别是语音处理领域一项具有挑战性的任务。因此,特征提取过程对于展示和处理语音信号至关重要。在本工作中,我们提出一种模型,该模型将原始音频文件直接输入深度神经网络,无需任何特征提取阶段即可识别情感,使用了六个不同的数据集:EMO-DB、RAVDESS、TESS、CREMA、SAVEE 以及 TESS+RAVDESS。为证明所提模型的贡献,将传统特征提取技术(即梅尔尺度谱图、梅尔频率倒谱系数)与机器学习算法、集成学习方法、深度及混合深度学习技术相结合。支持向量机、决策树、朴素贝叶斯、随机森林模型作为机器学习算法进行评估,而多数投票与堆叠方法作为集成学习技术进行评估。此外,卷积神经网络、长短期记忆网络以及混合 CNN-LSTM 模型作为深度学习技术进行评估,并与机器学习和集成学习方法比较。为证明所提模型的有效性,与最先进研究进行了对比。基于实验结果,CNN 模型在 TESS+RAVDESS 数据集上利用原始音频文件以 95.86% 的准确率超越现有方法,从而确立了新的 SOTA。所提模型在说话人无关的音频分类问题中,以 CNN 模型对 EMO-DB 达到 90.34% 准确率,以 CNN 模型对 RAVDESS 达到 90.42% 准确率,以 LSTM 模型对 TESS 达到 99.48% 准确率,以 CNN 模型对 CREMA 达到 69.72% 准确率,以 CNN 模型对 SAVEE 达到 85.76% 准确率。
引用
@article{arxiv.2307.02820,
title = {Evaluating raw waveforms with deep learning frameworks for speech emotion recognition},
author = {Zeynep Hilal Kilimci and Ulku Bayraktar and Ayhan Kucukmanisa},
journal= {arXiv preprint arXiv:2307.02820},
year = {2023}
}
备注
14 pages, 6 Figures, 8 Tables