中文

基于残差引导的非侵入式语音质量评估

声音 2022-03-23 v1 机器学习 音频与语音处理

摘要

本文提出一种基于受损语音与增强语音之间残差来改进非侵入式语音质量评估(NI-SQA)的方法。我们任务的难点尤其在于信息匮乏,因为相应的参考语音缺失。我们在受损语音上生成增强语音以补偿参考音频的缺失,然后将残差信息与受损语音配对。与直接将受损语音输入模型相比,残差可从增强的对比中带来一些额外的有用信息。人耳对某些噪声敏感,而深度学习模型则不同。导致模型预测的平均意见分数(MOS)不足以很好地拟合我们的主观敏感度并造成偏差。这些残差与参考语音密切相关,从而提升了深度学习模型预测 MOS 的能力。在训练阶段,实验结果表明,在相同条件下配对残差可快速获得更好的评估指标。此外,我们的最终结果在 PLCC 和 RMSE 上分别提升了 31.3% 和 14.1%。

关键词

引用

@article{arxiv.2203.11499,
  title  = {Residual-Guided Non-Intrusive Speech Quality Assessment},
  author = {Zhe Ye and Jiahao Chen and Diqun Yan},
  journal= {arXiv preprint arXiv:2203.11499},
  year   = {2022}
}

备注

Submitted to Interspeech 2022