SpeechWeave:用于训练语音合成模型的多语言合成文本与音频数据生成管道
计算与语言
2025-10-03 v2 人工智能
机器学习
多媒体
声音
音频与语音处理
摘要
高质量语音合成(TTS)模型训练需要大量且具有多样性的文本和语音数据。由于数据领域特定性、授权问题和可扩展性限制,从真实来源获取此类数据具有挑战性。虽然大语言模型(LLM)可以生成文本数据,但其生成的文本在提示词过程中缺乏足够的变异性,导致重复。TTS 训练数据中的另一个重要方面是文本规范化。规范化工具偶尔会引入异常或忽略有价值的模式,从而影响数据质量。此外,依赖语音艺术家进行大规模录音在商业化 TTS 系统中不可行,尤其是标准化语音。为此,我们提出了 SpeechWeave,一个能够自动生成多语言、特定领域数据集用于训练 TTS 模型的合成语音数据生成管道。我们的实验表明,该管道在各种语言和音标指标上生成的数据多样性比基准更高 10-48%,同时生成约 97% 正确规范化的文本。我们的做法实现了 TTS 训练的可扩展、高质量数据生成,提高了生成数据集的多样性、规范化和语音一致性。
引用
@article{arxiv.2509.14270,
title = {SpeechWeave: Diverse Multilingual Synthetic Text & Audio Data Generation Pipeline for Training Text to Speech Models},
author = {Karan Dua and Puneet Mittal and Ranjeet Gupta and Hitesh Laxmichand Patel},
journal= {arXiv preprint arXiv:2509.14270},
year = {2025}
}
备注
Accepted at ACL 2025