中文

赋能全球语音:面向高保真语音合成的数据高效且音素-声调自适应方法

声音 2025-04-11 v1 人工智能

摘要

文本转语音(TTS)技术在广泛使用的语言上取得了令人瞩目的成果,但许多低资源语言仍受限于数据匮乏和语言复杂性。在本文中,我们提出了一种新颖的方法,将数据优化框架与先进的声学模型相结合,以在低资源场景下构建高质量的 TTS 系统。我们以泰语作为说明性案例展示了该方法的有效性,其中复杂的语音规则和稀疏的资源得到了有效处理。我们的方法支持零样本语音克隆,并在从金融、医疗保健、教育到法律等多样化的客户应用中实现了性能提升。广泛的主客观评估证实,我们的模型达到了 SOTA 标准,为数据受限环境下的 TTS 生产提供了可扩展的解决方案,对更广泛的行业应用和多语言可及性具有深远意义。

关键词

引用

@article{arxiv.2504.07858,
  title  = {Empowering Global Voices: A Data-Efficient, Phoneme-Tone Adaptive Approach to High-Fidelity Speech Synthesis},
  author = {Yizhong Geng and Jizhuo Xu and Zeyu Liang and Jinghan Yang and Xiaoyi Shi and Xiaoyu Shen},
  journal= {arXiv preprint arXiv:2504.07858},
  year   = {2025}
}