中文

增强合成语音命令训练数据:从基于 ASR 的过滤到 SSL 潜在空间中的域适应

声音 2024-09-20 v1 人工智能 机器学习 音频与语音处理

摘要

合成语音作为数据增强正在越来越受欢迎,广泛应用于自动语音识别和语音分类任务。尽管新型文本转语音系统具备语音克隆能力,允许基于短音频片段使用更多声线,但这些系统倾向于幻听,常常产生质量较差的数据,将对下游任务产生负面影响。本文围绕合成语音数据进行零样本学习实验,专注于语音命令分类任务。我们的实验结果表明,简单的基于 ASR 的过滤方法对生成数据的质量影响巨大,能够显著提升性能。此外,尽管生成的语音数据质量较好,我们还发现合成语音与真实语音在使用自监督(WavLM)特征时仍易被区分,这一现象通过 CycleGAN 进一步探索,以弥合两类语音材料之间的差距。

关键词

引用

@article{arxiv.2409.12745,
  title  = {Enhancing Synthetic Training Data for Speech Commands: From ASR-Based Filtering to Domain Adaptation in SSL Latent Space},
  author = {Sebastião Quintas and Isabelle Ferrané and Thomas Pellegrini},
  journal= {arXiv preprint arXiv:2409.12745},
  year   = {2024}
}