面向语音情感识别的常量 Q 滤波器组表示分析
音频与语音处理
2022-11-30 v1 声音
摘要
本工作分析了用于语音情感识别 (SER) 的基于常量 Q 滤波器组的时频表示。常量 Q 滤波器组提供了非线性频谱时间表示,在低频处具有更高的频率分辨率。我们的研究揭示了提高的低频分辨率如何有益于 SER。在时域上对短时 mel 频率频谱系数 与基于常量 Q 滤波器组的特征(即常量 Q 变换 (CQT) 与连续小波变换 (CWT))进行的比较分析表明,常量 Q 表示在低频处提供了更高的时间不变性。这提供了对与情感无关的音高时间变化的更强鲁棒性,对于低唤醒度情感尤为如此。在不同情感类别上的相应频域分析表明,基于常量 Q 的时频表示比 MFSC 具有更好的音高谐波分辨率。常量 Q 表示的这些优势在 SER 性能上得到了进一步巩固:我们在四个公开可用的数据库上,使用六种先进的深度神经网络架构作为后端分类器,对特征进行了广泛评估。本研究中的推论暗示了常量 Q 特征对 SER 的适用性与潜力。
引用
@article{arxiv.2211.16363,
title = {Analysis of constant-Q filterbank based representations for speech emotion recognition},
author = {Premjeet Singh and Shefali Waldekar and Md Sahidullah and Goutam Saha},
journal= {arXiv preprint arXiv:2211.16363},
year = {2022}
}
备注
Accepted for publication in Elsevier's Digital Signal Processing Journal