利用深度神经网络进行语音情感识别的调制谱特征
音频与语音处理
2023-01-18 v1 声音
摘要
本研究探讨了基于常 Q 变换的调制谱特征(CQT-MSF)在语音情感识别(SER)中的应用。人类对声音的感知与分析包含两个重要的认知部分:早期听觉分析和基于皮层的处理。早期听觉分析考虑基于频谱图的表示,而基于皮层的处理包括从频谱图中提取时间调制。频谱图的这种时间调制表示被称为调制谱特征(MSF)。由于常 Q 变换(CQT)在语音中情感显著的低频区域提供了更高的分辨率,我们发现基于 CQT 的频谱图及其时间调制提供了富含情感特定信息的表示。我们论证了将 CQT-MSF 与二维卷积网络结合使用,可以为 SER 提供时移不变且形变不敏感的表示。我们的结果表明,在两个流行的 SER 数据库 Berlin EmoDB 和 RAVDESS 上,CQT-MSF 优于标准的基于 mel 尺度的频谱图及其调制特征。我们还表明,我们提出的特征优于具有平移和形变不变性的散射变换系数,从而表明了联合人工设计与自学习特征提取的重要性,而非完全依赖人工设计特征。最后,我们进行 Grad-CAM 分析,以直观检查常 Q 调制特征在 SER 上的贡献。
引用
@article{arxiv.2301.05868,
title = {Modulation spectral features for speech emotion recognition using deep neural networks},
author = {Premjeet Singh and Md Sahidullah and Goutam Saha},
journal= {arXiv preprint arXiv:2301.05868},
year = {2023}
}
备注
Accepted for publication in Elsevier's Speech Communication Journal