基于常数 Q 变换的非线性频率扭曲用于语音情感识别
音频与语音处理
2021-02-09 v1 机器学习
声音
信号处理
摘要
在本工作中,我们探索常数 Q 变换(CQT)用于语音情感识别(SER)。基于 CQT 的时频分析提供可变谱时分辨率,在较低频率处具有更高频率分辨率。由于语音信号的低频区域比高频区域含有更多与情感相关的信息,CQT 增强的低频分辨率使其比标准短时傅里叶变换(STFT)更有望用于 SER。我们基于 STFT 和 CQT 的短期声学特征,以深度神经网络(DNN)作为后端分类器,给出了用于 SER 的对比分析。我们优化了两种特征的不同参数。基于 CQT 的特征在 SER 实验中优于基于 STFT 的频谱特征。进一步的跨语料库评估实验表明,基于 CQT 的系统在使用域外训练数据时提供了更好的泛化能力。
引用
@article{arxiv.2102.04029,
title = {Non-linear frequency warping using constant-Q transformation for speech emotion recognition},
author = {Premjeet Singh and Goutam Saha and Md Sahidullah},
journal= {arXiv preprint arXiv:2102.04029},
year = {2021}
}
备注
Accepted for publication in 2021 IEEE International Conference on Computer Communication and Informatics (IEEE ICCCI 2021)