基于特征工程的语音情感检测新型混合深度学习技术
声音
2026-01-15 v2 人工智能
机器学习
音频与语音处理
摘要
如今,语音情感识别(SER)在人机交互(HCI)和人工智能(AI)领域发挥着关键作用。我们提出的 DCRF-BiLSTM 模型用于识别七种情感:中性、开心、悲伤、愤怒、恐惧、厌恶和惊讶,这些模型在五个数据集上训练:RAVDESS(R)、TESS(T)、SAVEE(S)、EmoDB(E)和 Crema-D(C)。该模型在各个数据集上实现了高准确率,包括在 RAVDESS 上达到 97.83%,在 SAVEE 上达到 97.02%,在 CREMA-D 上达到 95.10%,而在 TESS 和 EMO-DB 上完美实现 100%。对于组合(R+T+S)数据集,达到 98.82% 的准确率,超越了先前报告的结果。在我们看来,尚无旁观者对单一 SER 模型在全部五个基准数据集(即 R+T+S+C+E)上进行评估。我们的工作引入了这一全面组合,实现了惊人的 93.76% 的总体准确率。这些结果确认了 DCRF-BiLSTM 框架在多样化数据集上的鲁棒性与可推广性。
关键词
引用
@article{arxiv.2507.07046,
title = {A Novel Hybrid Deep Learning Technique for Speech Emotion Detection using Feature Engineering},
author = {Shahana Yasmin Chowdhury and Bithi Banik and Md Tamjidul Hoque and Shreya Banerjee},
journal= {arXiv preprint arXiv:2507.07046},
year = {2026}
}
备注
17 pages, 11 figures