低资源语音合成中迁移学习的策略:音素映射、特征输入与源语言选择
计算与语言
2023-06-22 v1 音频与语音处理
摘要
我们比较了在低资源语言 TTS 的迁移学习中使用基于 PHOIBLE 的音素映射方法和使用音系特征输入。我们使用多样的源语言(英语、芬兰语、印地语、日语和俄语)和目标语言(保加利亚语、格鲁吉亚语、哈萨克语、斯瓦希里语、乌尔都语和乌兹别克语)来测试方法的语言无关性并增强发现的适用性。我们使用来自自动语音识别的字符错误率和预测的平均意见得分进行评估。结果表明,音素映射和特征输入都改善了输出质量,且后者表现更好,但这些效果也依赖于具体的语言组合。我们还比较了最近提出的音素频率角相似度(ASPF)与基于系谱树的距离度量,作为迁移学习中源语言选择的标准。若使用基于标签的音素输入,ASPF 被证明是有效的,而语言距离没有预期的效果。
引用
@article{arxiv.2306.12040,
title = {Strategies in Transfer Learning for Low-Resource Speech Synthesis: Phone Mapping, Features Input, and Source Language Selection},
author = {Phat Do and Matt Coler and Jelske Dijkstra and Esther Klabbers},
journal= {arXiv preprint arXiv:2306.12040},
year = {2023}
}
备注
Accepted at the Speech Synthesis Workshop 2023