中文

面向低资源语言文本转语音中自动 MOS 预测的资源高效微调策略

音频与语音处理 2023-06-01 v1 计算与语言

摘要

我们基于 wav2vec 2.0,利用开放获取数据集 BVCC 与 SOMOS 训练了一个 MOS 预测模型。我们在低资源语言(LRL)西弗里斯兰语的神经网络 TTS 数据上的测试表明,先在 BVCC 上预训练再于 SOMOS 上微调,对微调与零样本预测均带来最佳精度。进一步微调实验显示,使用超过总量 30% 的数据并未带来显著改进。此外,使用单一听者数据微调展现出有前景的系统级精度,支撑了单人试点测试的可行性。这些发现均可通过推进更好的零样本 MOS 预测并指导听音测试设计(尤其早期评估中),协助 LRL 的 TTS 资源节约型开发。

关键词

引用

@article{arxiv.2305.19396,
  title  = {Resource-Efficient Fine-Tuning Strategies for Automatic MOS Prediction in Text-to-Speech for Low-Resource Languages},
  author = {Phat Do and Matt Coler and Jelske Dijkstra and Esther Klabbers},
  journal= {arXiv preprint arXiv:2305.19396},
  year   = {2023}
}

备注

Accepted at INTERSPEECH 2023