Synth4Kws:用于低资源环境中用户定义关键词检测的合成语音
音频与语音处理
2026-02-06 v1 人工智能
摘要
开发高质量自定义关键词检测(KWS)模型的挑战之一是收集覆盖广泛语言、短语和说话风格的训练数据的过程既漫长又昂贴。我们引入 Synth4Kws——一个利用文本转语音(TTS)合成数据用于不同资源设置下的自定义 KWS 的框架。在无真实数据情况下,我们发现增加 TTS 短语多样性和 utterance 采样呈单调上升趋势,可显著改善模型性能,依据 EER 和 AUC 指标评估了 11k 条语音命令数据集的 utterances。在低资源环境中,以 50k 真实 utterances 作为基准,我们发现使用最优数量的 TTS 数据可将 EER 提升 30.1%,AUC 提升 46.7%。此外,我们将 TTS 数据与不同比例的真实数据混合,并插值实现各种质量目标所需的真实数据。我们的实验基于英语和单字utterances,但发现结果可推广至 i18n 语言和其他关键词类型。
引用
@article{arxiv.2407.16840,
title = {Synth4Kws: Synthesized Speech for User Defined Keyword Spotting in Low Resource Environments},
author = {Pai Zhu and Dhruuv Agarwal and Jacob W. Bartel and Kurt Partridge and Hyun Jin Park and Quan Wang},
journal= {arXiv preprint arXiv:2407.16840},
year = {2026}
}
备注
5 pages, 5 figures, 2 tables The paper is accepted in Interspeech SynData4GenAI 2024 Workshop - https://syndata4genai.org/#call-for-papers