生成式语音技术时代的众包 MUSHRA 测试:主观与客观测试方法的比较分析
音频与语音处理
2025-06-03 v1 声音
摘要
MUSHRA 框架被广泛用于检测细微的音频质量差异,但传统上依赖于受控环境中的专家听者,这使得其成本高昂且不适用于模型开发。因此,在开发过程中通常使用客观指标,而专家评估则在后期进行。虽然这些指标对传统 DSP 编解码器有效,但通常无法可靠地评估生成式模型。本文提出了针对非专家众包听者进行 MUSHRA 测试的改进方案,重点关注生成式语音编解码器。我们通过将 MTurk 和 Prolific 众包平台的结果与专家听者数据进行比较,评估了重测信度与一致性,从而验证了我们的方法。此外,我们评估了六项客观指标,表明传统指标低估了生成式模型。我们的发现揭示了特定平台的偏差,并强调了编解码器感知指标,为语音编解码器的可扩展感知测试提供了指导。
引用
@article{arxiv.2506.00950,
title = {Crowdsourcing MUSHRA Tests in the Age of Generative Speech Technologies: A Comparative Analysis of Subjective and Objective Testing Methods},
author = {Laura Lechler and Chamran Moradi and Ivana Balic},
journal= {arXiv preprint arXiv:2506.00950},
year = {2025}
}
备注
This is a preprint of a paper submitted to and accepted for INTERSPEECH 2025