EmoAugNet:面向语音情感识别的信号增强混合 CNN-LSTM 框架
声音
2025-08-11 v1 人机交互
机器学习
摘要
识别语音中的情感信号对增强人机交互 (HCI) 的效果具有重要影响。本研究介绍了 EmoAugNet,一种混合深度学习框架,集成了长短期记忆 (LSTM) 层与一维卷积神经网络 (1D-CNN),以实现可靠的语音情感识别 (SER)。语音信号提取特征的质量和种类对 SER 系统的性能影响显著。本文采用了综合性的语音数据增强策略,将传统方法(如噪声添加、基调移动和时间拉伸)与 novel 组合式增强管道结合,以提升泛化性并减少过拟合。每个音频样本通过均方根能量 (RMSE)、梅尔频率倒谱系数 (MFCC) 和零交叉率 (ZCR) 转换为高维特征向量。本模型在 IEMOCAP 数据集上采用 ReLU 激活函数时,加权准确率为 95.78%,未加权准确率为 92.52%;采用 ELU 激活函数时,加权准确率为 96.75%,未加权准确率为 91.28%。在 RAVDESS 数据集上,ReLU 激活下加权准确率为 94.53%,未加权准确率为 94.98%;ELU 激活下加权准确率为 93.72%,未加权准确率为 94.64%。这些结果凸显了 EmoAugNet 通过集成数据增强和混合建模在提升 SER 系统鲁棒性和性能方面的有效性。
引用
@article{arxiv.2508.06321,
title = {EmoAugNet: A Signal-Augmented Hybrid CNN-LSTM Framework for Speech Emotion Recognition},
author = {Durjoy Chandra Paul and Gaurob Saha and Md Amjad Hossain},
journal= {arXiv preprint arXiv:2508.06321},
year = {2025}
}
备注
To be published in ICCCNT 2025 (16th International Conference on Computing Communication and Networking Technologies)