中文

时域、频域与倒谱域声学特征融合用于语音指令分类

声音 2022-06-20 v2 音频与语音处理

摘要

在语音相关分类任务中,常使用频域声学特征(如对数梅尔滤波器组系数(FBANK))与倒谱域声学特征(如梅尔频率倒谱系数(MFCC))。然而,时域特征在一些包含非语音或弱语音相关声音的声音分类任务中表现更有效。我们此前提出了一种称为比特序列表示(BSR)的特征,这是一种基于原始波形的时域二值声学特征。与 MFCC 相比,BSR 在环境声音检测中表现更优,并在小词汇量语音识别任务中展现出可比的准确率性能。本文中,我们提出一种 BSR 的改进新特征,称为 BSR-float16,以更精确地表示浮点值。我们利用 Google 提出的称为 Speech Commands 的数据集,通过实验证明了时域、频域与倒谱域特征间的互补性。因此,我们采用一种简单的后端分数融合方法来提升最终分类准确率。融合结果也展现出更好的噪声鲁棒性。

关键词

引用

@article{arxiv.2203.16085,
  title  = {Combination of Time-domain, Frequency-domain, and Cepstral-domain Acoustic Features for Speech Commands Classification},
  author = {Yikang Wang and Hiromitsu Nishizaki},
  journal= {arXiv preprint arXiv:2203.16085},
  year   = {2022}
}

备注

5 pages, 4 figures