中文

FMSD-TTS:面向“U-Tsang、Amdo和Kham方言语料生成的少样本多说话人多方言文本转语音

声音 2026-04-27 v4 人工智能 计算与语言 音频与语音处理

摘要

藏语为低资源语言,缺乏跨其三个主要方言——“U-Tsang、Amdo和Kham——的大规模平行语音语料,限制了语音模型的发展。为此,我们提出FMSD-TTS,一个少样本、多说话人、多方言文本转语音框架,能够从有限的参考音频和明确的方言标签合成平行方言语音。本方法特点包括新颖的说话人-方言融合模块和方言专用动态路由网络(DSDR-Net),以捕捉跨方言的细粒度声学与语言变异,同时保持说话人身份。 extensive objective and subjective 评估表明,FMSD-TTS在方言表达性和说话人相似性方面显著优于基线方法。我们进一步通过一项具有挑战性的语音转语音方言转换任务验证了合成语音的质量与实用性。我们的贡献包括:(1)面向藏语多方言语音合成的新颖少样本TTS系统;(2)由FMSD-TTS生成的大规模合成藏语语料库的公开发布;(3)用于标准化评估说话人相似性、方言一致性和音频质量的开源评估工具包。

关键词

引用

@article{arxiv.2505.14351,
  title  = {FMSD-TTS: Few-shot Multi-Speaker Multi-Dialect Text-to-Speech Synthesis for \"U-Tsang, Amdo and Kham Speech Dataset Generation},
  author = {Yutong Liu and Ziyue Zhang and Ban Ma-bao and Yuqing Cai and Yongbin Yu and Renzeng Duojie and Xiangxiang Wang and Fan Gao and Cheng Huang and Nyima Tashi},
  journal= {arXiv preprint arXiv:2505.14351},
  year   = {2026}
}

备注

This paper has been substantially restructured using a revised writing style. In addition, considering that maintaining two preprints simultaneously may not fully align with academic publishing ethics, we have withdrawn the previous version. Please refer to the updated manuscript at: arXiv:509.18060