增强合成语音命令训练数据:从基于 ASR 的过滤到 SSL 潜在空间中的域适应
声音
2024-09-20 v1 人工智能
机器学习
音频与语音处理
摘要
合成语音作为数据增强正在越来越受欢迎,广泛应用于自动语音识别和语音分类任务。尽管新型文本转语音系统具备语音克隆能力,允许基于短音频片段使用更多声线,但这些系统倾向于幻听,常常产生质量较差的数据,将对下游任务产生负面影响。本文围绕合成语音数据进行零样本学习实验,专注于语音命令分类任务。我们的实验结果表明,简单的基于 ASR 的过滤方法对生成数据的质量影响巨大,能够显著提升性能。此外,尽管生成的语音数据质量较好,我们还发现合成语音与真实语音在使用自监督(WavLM)特征时仍易被区分,这一现象通过 CycleGAN 进一步探索,以弥合两类语音材料之间的差距。
引用
@article{arxiv.2409.12745,
title = {Enhancing Synthetic Training Data for Speech Commands: From ASR-Based Filtering to Domain Adaptation in SSL Latent Space},
author = {Sebastião Quintas and Isabelle Ferrané and Thomas Pellegrini},
journal= {arXiv preprint arXiv:2409.12745},
year = {2024}
}