LDNet:合成语音 MOS 预测中的统一听者依赖建模
声音
2021-10-19 v1 计算与语言
音频与语音处理
摘要
自动预测合成语音主观评分的一种有效方法是在带有人类标注分数的听力测试数据集上进行训练。尽管数据集中的每个语音样本都由多名听者进行评分,但先前的大多数工作仅使用平均分作为训练目标。在本研究中,我们提出了 LDNet,一个用于平均意见分 (MOS) 预测的统一框架,该框架在给定输入语音和听者身份的情况下预测听者个人的感知质量。我们反映了听者依赖 (LD) 建模的最新进展,包括模型架构的设计选择,并提出了两种提供更稳定结果和高效计算的推理方法。我们在语音转换挑战赛 (VCC) 2018 基准和新收集的大规模 MOS 数据集上进行了系统实验,对所提出的框架进行了深入分析。结果表明,平均听者推理方法是利用平均分的一种更好方式,当每个样本拥有更多评分时,其有效性更为明显。
引用
@article{arxiv.2110.09103,
title = {LDNet: Unified Listener Dependent Modeling in MOS Prediction for Synthetic Speech},
author = {Wen-Chin Huang and Erica Cooper and Junichi Yamagishi and Tomoki Toda},
journal= {arXiv preprint arXiv:2110.09103},
year = {2021}
}
备注
Submitted to ICASSP 2022. Code available at: https://github.com/unilight/LDNet