众包中噪声抑制算法的主观评价
音频与语音处理
2021-04-19 v2 声音
摘要
包含噪声抑制算法的语音通信系统的质量通常依据 ITU-T Rec. P.835 在实验室实验中评价,其中参与者分别对背景噪声、语音信号和整体质量打分。本文介绍一个开源工具包,用于在众包中对噪声抑制后的语音进行主观质量评价。我们遵循 ITU-T Rec. P.835 与 P.808,并高度自动化流程以防止管理员误差。为评估评价方法的有效性,我们将用本实现收集评分计算的平均意见分(MOS)与按 ITU-T Rec. P.835 进行的标准实验室实验的 MOS 值进行比较。结果显示在背景噪声、语音信号和整体质量三个尺度上均具有高有效性(平均 PCC = 0.961)。循环测试(N=5)结果表明本实现也是高度可复现的评价方法(PCC=0.99)。最后,我们在 INTERSPEECH 2021 深度噪声抑制挑战赛中将其作为首要评价指标,表明其可规模化实用。结果被分析以确定为何在背景噪声与语音质量方面整体表现最佳。
引用
@article{arxiv.2010.13200,
title = {Subjective Evaluation of Noise Suppression Algorithms in Crowdsourcing},
author = {Babak Naderi and Ross Cutler},
journal= {arXiv preprint arXiv:2010.13200},
year = {2021}
}