中文

预测分数分布以改进非侵入式语音质量估计

声音 2022-04-15 v1 音频与语音处理

摘要

深度噪声抑制器(DNS)已成为一种颇具吸引力的解决方案,用于从语音中去除背景噪声、混响与失真,并广泛应用于电话/语音应用。它们偶尔也易于引入伪影并降低语音的感知质量。使用多名人类评判者得出平均意见分数(MOS)的主观听测是衡量这些模型性能的流行方式。基于深度神经网络的非侵入式 MOS 估计模型近来已成为这些测试的一种流行且具成本效益的替代方案。这些模型仅使用 MOS 标签训练,常丢弃评分分数的次要统计信息。在本文中,我们研究若干种整合评分分数分布(如方差、直方图信息)以改进 MOS 估计性能的方法。我们的模型在由 320 个不同 DNS 模型及模型变体去噪的 419K 样本语料上训练,并在来自 DNSMOS 的 18K 测试样本上评估。我们表明,通过对单任务 MOS 估计流程非常细微的修改,这些免费可用的标签可带来高达 0.016 RMSE 与 1% SRCC 的提升。

关键词

引用

@article{arxiv.2204.06616,
  title  = {Predicting score distribution to improve non-intrusive speech quality estimation},
  author = {Abu Zaher Md Faridee and Hannes Gamper},
  journal= {arXiv preprint arXiv:2204.06616},
  year   = {2022}
}

备注

Submitted to Interspeech 2022