中文

单通道语音增强能否提升关键词 spotting 准确率?一项案例研究

音频与语音处理 2024-02-23 v2 声音

摘要

噪声鲁棒性是成功语音应用的关键方面。语音增强(SE)已被研究用于提升自动语音识别准确率;然而其对关键词 spotting(KWS)的有效性仍缺乏充分研究。在本文中,我们在 Google Speech Command(GSC)数据集上针对关键词 spotting 的单通道语音增强开展了综合研究。为考察对噪声的鲁棒性,将 GSC 数据集用来自 WSJ0 Hipster Ambient Mixtures(WHAM!)噪声数据集的噪声信号进行增广。我们的研究不仅包括将 SE 应用于 KWS 之前,还包括对 SE 前端与 KWS 后端模型进行联合训练。此外,我们探索了音频注入,一种通过使用增强信号与原始信号的加权平均来减少失真的常用方法。随后利用另一个预测每条语句权重的模型对音频注入作进一步优化。我们的研究表明,当后端模型在干净语音上训练时,SE 可提升噪声语音上的 KWS 准确率;然而,尽管我们进行了广泛探索,当后端在噪声语音上训练时,难以通过 SE 改善 KWS 准确率。

关键词

引用

@article{arxiv.2309.16060,
  title  = {Does Single-channel Speech Enhancement Improve Keyword Spotting Accuracy? A Case Study},
  author = {Avamarie Brueggeman and Takuya Higuchi and Masood Delfarah and Stephen Shum and Vineet Garg},
  journal= {arXiv preprint arXiv:2309.16060},
  year   = {2024}
}