MooseNet:一种带有PLDA模块的可训练合成语音度量
计算与语言
2023-10-27 v2 声音
音频与语音处理
摘要
我们提出MooseNet,一种可训练的语音度量,用于预测听者的平均意见得分(MOS)。我们提出了一种新方法,将概率线性判别分析(PLDA)生成模型应用于自监督学习(SSL)神经网络(NN)模型所获得的嵌入之上。我们表明,PLDA在仅以136条语句(约一分钟训练时间)训练时,能与未微调的SSL模型良好配合,并且PLDA持续地改进各种神经MOS预测模型,即便是具有任务特定微调的最先进模型。我们的消融研究表明,在低资源场景下,PLDA训练优于SSL模型微调。我们还通过便捷的优化器选择以及额外的对比与多任务训练目标改进了SSL模型微调。带有PLDA模块的微调MooseNet NN取得了最佳结果,在VoiceMOS Challenge数据上超越了SSL基线。
引用
@article{arxiv.2301.07087,
title = {MooseNet: A Trainable Metric for Synthesized Speech with a PLDA Module},
author = {Ondřej Plátek and Ondřej Dušek},
journal= {arXiv preprint arXiv:2301.07087},
year = {2023}
}
备注
Accepted to SSW 12: https://openreview.net/forum?id=V6RZk6RzSu