中文

面向 ASR 的基于 TTS 与 VC 数据增强的详尽评估

音频与语音处理 2025-03-13 v1 计算与语言

摘要

近年来,利用文本到语音(TTS)或语音转换(VC)生成的合成数据来增强自动语音识别(ASR)系统的训练数据已变得日益流行。多项研究证明了使用这种增强方法能提升 ASR 性能。然而,由于合成语音的多样性较低,简单地将合成数据与真实数据结合通常无法获得最佳结果。在本研究中,我们利用近期提出的基于流的 TTS/VC 模型以获得更高的语音多样性,并评估了增强不同语音属性对几种 ASR 模型词错率(WER)的各自影响。在我们的设置中,发现音高增强和基于 VC 的说话人增强是无效的。与仅使用真实数据进行训练相比,联合增强所有其他属性使 Conformer-Transducer 模型在 Common Voice 上的 WER 相对降低了 11%,在 LibriSpeech 上最高相对降低了 35%。

关键词

引用

@article{arxiv.2503.08954,
  title  = {An Exhaustive Evaluation of TTS- and VC-based Data Augmentation for ASR},
  author = {Sewade Ogun and Vincent Colotte and Emmanuel Vincent},
  journal= {arXiv preprint arXiv:2503.08954},
  year   = {2025}
}