中文

基于比较类别评分的众包设计用于评估语音增强算法

音频与语音处理 2023-06-05 v1

摘要

语音增强技术通过去除不需要的噪声来改善音频信号的质量或可懂度。它用作众多应用(如语音识别、助听器、广播与电话)中的预处理。此类算法的评估常依赖于基于参考的客观度量,而这些度量被表明与人类感知相关性较差。为了评估人类观察者所感知的音频质量,诉诸主观质量评估因而至关重要。本文中,基于众包(主观)与比较类别评分(CCR)方法的用户评估,与 DNSMOS、ViSQOL 和 3QUEST(客观)度量进行了比较。来自实时通信(RTC)的三种语音增强算法的整体质量分数使用 P.808 工具包参与比较。结果表明,尽管 CCR 量表允许参与者识别处理与未处理音频样本之间的差异,但出现了两类偏好:一些用户通过关注噪声抑制处理而给出正面评分,而另一些主要通过关注语音质量而给出负面评分。我们进一步给出了基于 CCR 的众包评估设计时所关键的参数、规模考量与说话人变化方面的结果。

关键词

引用

@article{arxiv.2306.01538,
  title  = {On Crowdsourcing-design with Comparison Category Rating for Evaluating Speech Enhancement Algorithms},
  author = {Angélica S. Z. Suárez and Clément Laroche and Line H. Clemmensen and Sneha Das},
  journal= {arXiv preprint arXiv:2306.01538},
  year   = {2023}
}

备注

Published at ICASSP 2023