中文

一种可扩展的含噪语音数据集与在线主观测试框架

声音 2019-09-19 v1 机器学习 音频与语音处理

摘要

背景噪声是网络语音协议(VoIP)和公共交换电话网络(PSTN)通话中质量损伤的主要来源。近期工作显示了深度学习在噪声抑制方面的有效性,但所用数据集相对于其他领域(如ImageNet)而言规模较小,且相关评估更为集中。为了更好地促进语音增强领域的深度学习研究,我们提出了一个含噪语音数据集(MS-SNSD),该数据集可根据所需的说话人数量、噪声类型和语音噪声比(SNR)水平扩展到任意规模。我们表明,增大数据集规模会如预期般提升噪声抑制性能。此外,我们提供了一种开源评估方法,利用众包大规模主观评估其结果,并采用参考算法对结果进行归一化。为展示该数据集与评估框架,我们将其应用于若干噪声抑制器,并将主观平均意见得分(MOS)与SNR、PESQ、POLQA和VISQOL等客观质量指标进行比较,说明了为何仍需要MOS。据我们所知,我们的主观MOS评估是首个大规模语音增强算法评估。

关键词

引用

@article{arxiv.1909.08050,
  title  = {A scalable noisy speech dataset and online subjective test framework},
  author = {Chandan K. A. Reddy and Ebrahim Beyrami and Jamie Pool and Ross Cutler and Sriram Srinivasan and Johannes Gehrke},
  journal= {arXiv preprint arXiv:1909.08050},
  year   = {2019}
}

备注

InterSpeech 2019