中文

SpeechWeave:用于训练语音合成模型的多语言合成文本与音频数据生成管道

计算与语言 2025-10-03 v2 人工智能 机器学习 多媒体 声音 音频与语音处理

摘要

高质量语音合成(TTS)模型训练需要大量且具有多样性的文本和语音数据。由于数据领域特定性、授权问题和可扩展性限制,从真实来源获取此类数据具有挑战性。虽然大语言模型(LLM)可以生成文本数据,但其生成的文本在提示词过程中缺乏足够的变异性,导致重复。TTS 训练数据中的另一个重要方面是文本规范化。规范化工具偶尔会引入异常或忽略有价值的模式,从而影响数据质量。此外,依赖语音艺术家进行大规模录音在商业化 TTS 系统中不可行,尤其是标准化语音。为此,我们提出了 SpeechWeave,一个能够自动生成多语言、特定领域数据集用于训练 TTS 模型的合成语音数据生成管道。我们的实验表明,该管道在各种语言和音标指标上生成的数据多样性比基准更高 10-48%,同时生成约 97% 正确规范化的文本。我们的做法实现了 TTS 训练的可扩展、高质量数据生成,提高了生成数据集的多样性、规范化和语音一致性。

关键词

引用

@article{arxiv.2509.14270,
  title  = {SpeechWeave: Diverse Multilingual Synthetic Text & Audio Data Generation Pipeline for Training Text to Speech Models},
  author = {Karan Dua and Puneet Mittal and Ranjeet Gupta and Hitesh Laxmichand Patel},
  journal= {arXiv preprint arXiv:2509.14270},
  year   = {2025}
}

备注

Accepted at ACL 2025