中文

利用TTS综合数据提高关键词检测模型开发效率

声音 2026-02-06 v1 机器学习 音频与语音处理

摘要

本文探讨了在最小化开发成本和时间的同时,使用TTS综合训练数据 for KWS(关键词检测)任务。关键词检测模型需要大量训练数据才能准确,而获取此类训练数据可能昂贵。当前的最先进技术表明,TTS模型可以生成大量自然听起来的数据,这有助于减少KWS模型开发的成本和时间。尽管如此,TTS生成的数据可能在多样性方面不如真实数据。为追求在有限资源和当前TTS能力约束下最大化KWS模型准确度,我们探索了 various strategies to mix TTS数据和真实人声数据,主要目标是最小化真实数据的使用并最大化TTS输出的多样性。我们的实验结果表明,少量真实音频数据(100名说话人,2k个utterances)与大量TTS综合数据可以实现相当高的准确率(相对于基线,误差率为3倍),而基线使用3.8M真实正面utterances进行训练。

关键词

引用

@article{arxiv.2407.18879,
  title  = {Utilizing TTS Synthesized Data for Efficient Development of Keyword Spotting Model},
  author = {Hyun Jin Park and Dhruuv Agarwal and Neng Chen and Rentao Sun and Kurt Partridge and Justin Chen and Harry Zhang and Pai Zhu and Jacob Bartel and Kyle Kastner and Gary Wang and Andrew Rosenberg and Quan Wang},
  journal= {arXiv preprint arXiv:2407.18879},
  year   = {2026}
}

备注

to be published in a Workshop at Interspeech 2024, Synthetic Data's Transformative Role in Foundational Speech Models