中文

论重构语音质量评估中的均值意见分数:通过量化分布拟合进行聚合

声音 2025-06-24 v1 音频与语音处理

摘要

语音质量评估(SQA)旨在评估语音样本的质量,而无需依赖耗时的听众问卷。近期努力集中于训练基于神经网络的 SQA 模型以预测语音样本(如由文本转语音或语音转换系统生成)的均值意见分数(MOS)。本文旨在提升 MOS 预测模型性能。我们提出一种新颖的得分聚合方法,以解决传统注释局限性——这些注释通常涉及对 1 到 5 之间的比例评级。我们的方法基于假设:注释者内部考虑连续得分,然后选择最近的离散评级。通过建模此过程,我们通过对潜在连续分布进行量化来逼近评级的生成分布。随后,我们使用通过量化分布与注释评级之间损失估计的潜在分布峰值,作为新的代表值代替 MOS。实验结果表明,用本文提出的值替换 MOSNet 的预测目标可提高预测性能。

关键词

引用

@article{arxiv.2506.18307,
  title  = {Rethinking Mean Opinion Scores in Speech Quality Assessment: Aggregation through Quantized Distribution Fitting},
  author = {Yuto Kondo and Hirokazu Kameoka and Kou Tanaka and Takuhiro Kaneko},
  journal= {arXiv preprint arXiv:2506.18307},
  year   = {2025}
}

备注

Accepted on ICASSP 2025