中文

用于语音情感识别的基音同步单频滤波谱图

音频与语音处理 2019-08-09 v1 机器学习 声音 机器学习

摘要

卷积神经网络(CNN)被广泛用于语音情感识别(SER)。在此类情况下,短时傅里叶变换(STFT)谱图是表示语音并作为CNN输入的最流行选择。然而,短时傅里叶变换的不确定性原理使其无法同时捕获时间与频率分辨率。另一方面,近期提出的单频滤波(SFF)谱图有望成为更好的替代方案,因为它可同时捕获时间与频率分辨率。本工作中,我们探索将SFF谱图作为SER中语音的替代表示。我们通过取两个连续声门闭合时刻(GCI)位置间所有样本幅度的平均值,对SFF谱图进行了修改。两个连续GCI位置间的时长给出基音,促使我们将修改后的SFF谱图命名为基音同步SFF谱图。GCI位置使用零频滤波方法检测。所提出的基音同步SFF谱图在IEMOCAP数据集上取得了63.95%(未加权)和70.4%(加权)的准确率。这相对于使用CNN的STFT谱图上的SOTA结果分别提升了+7.35%(未加权)和+4.3%(加权)。特别地,所提方法正确识别了22.7%的快乐情绪样本,而SOTA结果中该数值为0%。这些结果也预示着所提基音同步SFF谱图在其他基于语音的应用中有更广泛的使用前景。

关键词

引用

@article{arxiv.1908.03054,
  title  = {Pitch-Synchronous Single Frequency Filtering Spectrogram for Speech Emotion Recognition},
  author = {Shruti Gupta and Md. Shah Fahad and Akshay Deepak},
  journal= {arXiv preprint arXiv:1908.03054},
  year   = {2019}
}

备注

11 pages and less than 20 figures