中文

基于四分之一频谱包络和 1D-CNN 的正常语音与低沙音语音分类

音频与语音处理 2024-08-27 v1 机器学习

摘要

低沙音作为一种语音形式,尚未得到主流语音应用的充分关注。这源于为正常语音构建的系统对低沙音语音并不如期。构建包含低沙音语音的语音应用程序的第一步是成功地对低沙音语音和正常语音进行分类。此类前端分类系统预期具有高准确率和低计算开销,这正是本文的研究范围。低沙音的一个特征是基本频率(或基频)的缺失,因此基频谐波也缺失。在正常语音中存在基频及其谐波,而在低沙音中则不存在,这一特征在傅里叶变换的频谱包络中表现出来。我们观察到这一特征在频谱的前四分之一最为突出,因而我们利用其作为特征。我们提出使用一维卷积神经网络(1D-CNN)从四分之一频谱包络(Quartered Spectral Envelope, QSE)中捕获这些特征。该系统在 wTIMIT 数据集上训练和测试时达到 99.31%的准确率,在 CHAINS 数据集上达到 100%。该提议特征与语音领域的标准特征——梅尔频率倒谱系数(MFCC)进行比较。该提议分类系统也与基于对数滤波器能量(LFBE)特征在长短期记忆网络(LSTM)上训练的先进系统进行比较。实验结果表明,基于 1D-CNN 的系统在多个实验中优于或相当于最先进的系统。它还能更快收敛,计算开销更小。最后,在各种信噪比下加入白噪声后,本系统表现出良好的鲁棒性。

关键词

引用

@article{arxiv.2408.13746,
  title  = {Quartered Spectral Envelope and 1D-CNN-based Classification of Normally Phonated and Whispered Speech},
  author = {S. Johanan Joysingh and P. Vijayalakshmi and T. Nagarajan},
  journal= {arXiv preprint arXiv:2408.13746},
  year   = {2024}
}

备注

13 pages, 6 figures, submitted to "Circuits, Systems, and Signal Processing"