用于低资源口音语音语料库自动语音识别的零样本文本到语音增强
音频与语音处理
2024-09-18 v1 声音
摘要
近年来,自动语音识别(ASR)模型在清洁、低噪声的声学条件以及混响环境中的转录性能都有了很大提高。然而,所有这些系统都依赖于在特定声学条件下数百小时标记训练数据的可用性。当这样的训练数据集不可用时,系统的性能会受到严重影响。例如,当特定的声学环境或特定的说话人群在训练数据集中代表性不足时,就会发生这种情况。具体来说,在本文中,我们研究了口音语音数据对现成ASR系统的影响。此外,我们提出了一种基于零样本文本到语音的策略来增强口音语音语料库。我们表明,这种增强方法能够将ASR系统在口音数据上的性能损失减轻高达5%的词错误率降低(WERR)。总之,我们证明,通过将一小部分真实数据与合成生成的数据相结合,ASR系统表现出比仅在真实口音语音上训练的模型更优越的性能,词错误率降低高达14%。
引用
@article{arxiv.2409.11107,
title = {Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora},
author = {Francesco Nespoli and Daniel Barreda and Patrick A. Naylor},
journal= {arXiv preprint arXiv:2409.11107},
year = {2024}
}
备注
Accepted to the Asilomar 2023 Conference