中文

MAC:一种提升低资源自动语音识别的统一框架

计算与语言 2023-02-16 v2 声音 音频与语音处理

摘要

我们提出了一种用于低资源自动语音识别任务的统一框架,称为元音频拼接(meta audio concatenation, MAC)。它易于实现,并可在极低资源环境下进行。在数学上,我们从贝叶斯采样(bayesian sampling)的角度对 MAC 框架给出了清晰的描述。在该框架中,我们利用一种新颖的拼接合成文本到语音(text-to-speech, TTS)系统来提升低资源 ASR 任务。通过拼接合成 TTS 系统,我们可以整合语言发音规则并调整 TTS 过程。此外,我们提出了广义的元音频集概念,以满足在使用该系统时不同语言和不同场景的建模需求。大量实验证明了 MAC 在低资源 ASR 任务上的显著有效性。对于粤语 ASR 任务、台湾话 ASR 任务和日语 ASR 任务中的 CTC 贪心搜索、CTC 前缀、注意力以及注意力重打分解码模式,MAC 方法可将字错率(CER)降低 15% 以上。此外,在 ASR 任务中,MAC 在粤语 common voice 数据集上击败了 wav2vec2(经微调),并在台湾话和日语的 common voice 数据集上取得了极具竞争力的结果。其中值得一提的是,我们在粤语 common voice ASR 任务上达到了 10.9% 的字错率(CER),相比 wav2vec2(经微调)带来了约 30% 的相对提升。

关键词

引用

@article{arxiv.2302.03498,
  title  = {MAC: A unified framework boosting low resource automatic speech recognition},
  author = {Zeping Min and Qian Ge and Zhong Li and Weinan E},
  journal= {arXiv preprint arXiv:2302.03498},
  year   = {2023}
}