关键词检测的对抗训练以最小化TTS数据过拟合
声音
2026-02-06 v1 机器学习
音频与语音处理
摘要
关键词检测(KWS)问题需要大量真实语音训练数据才能在不同人群中实现高精度。利用大量文本转语音(TTS)合成数据可以减少KWS开发的时间和成本。然而,TTS数据可能包含真实语音中不存在的伪影,KWS模型可以利用这些伪影(过拟合),从而导致在真实语音上的准确率下降。为解决这一问题,我们提出应用对抗训练方法,防止KWS模型在使用大量TTS数据训练时学习TTS特定特征。实验结果表明,当在原始KWS损失之外使用对抗损失时,KWS模型在真实语音数据上的准确率可提高高达12%。令人惊讶的是,我们还观察到,即使仅使用TTS和真实负样本语音数据进行训练而不使用任何真实正样本,对抗设置也能将准确率提高高达8%。
引用
@article{arxiv.2408.10463,
title = {Adversarial training of Keyword Spotting to Minimize TTS Data Overfitting},
author = {Hyun Jin Park and Dhruuv Agarwal and Neng Chen and Rentao Sun and Kurt Partridge and Justin Chen and Harry Zhang and Pai Zhu and Jacob Bartel and Kyle Kastner and Gary Wang and Andrew Rosenberg and Quan Wang},
journal= {arXiv preprint arXiv:2408.10463},
year = {2026}
}
备注
to be published in a Workshop at Interspeech 2024, Synthetic Data's Transformative Role in Foundational Speech Models