中文

用于训练 MOS 预测模型的 N 低分选取

声音 2025-06-24 v1 音频与语音处理

摘要

自动语音质量评估 (SQA) 已被广泛研究,以无需耗时的问卷来预测语音质量。最近,针对由文本转语音或语音转换产生的语音样本,开发了基于神经网络的 SQA 模型,主要侧重于训练语音质量均值意见分数 (MOS) 预测模型。每个语音样本的质量可能在整个时长内不一致,但尚不清楚哪些语音段落在分配主观评估以计算 MOS 时获得主要关注。我们假设,当人类对语音进行评分时,他们倾向于为低质量语音段落分配更高的权重,而每个样本的评分差异主要源于忽略差质量语音段落时意外赋予更高分数。针对该假设,我们分析了 VCC2018 和 BVCC 数据集。基于该假设,我们提出了更可靠的代表值 N_low-MOS,即 NN 个最低意见分数的均值。我们的实验表明,采用 N_low-MOS 进行 MOSNet 训练时,LCC 和 SRCC 均优于常规 MOS。该结果表明 N_low-MOS 是主观语音质量的更内在代表值,并且使 MOSNet 成为 VC 模型的更好比较器。

关键词

引用

@article{arxiv.2506.18326,
  title  = {Selecting N-lowest scores for training MOS prediction models},
  author = {Yuto Kondo and Hirokazu Kameoka and Kou Tanaka and Takuhiro Kaneko},
  journal= {arXiv preprint arXiv:2506.18326},
  year   = {2025}
}

备注

Accepted on ICASSP 2024