中文

面向上下文中文语音识别的高效文本增强方法

声音 2024-06-17 v1 计算与语言 音频与语音处理

摘要

虽然上下文自动语音识别 (ASR) 系统常用于提高罕见词识别效果,但其效果受限于语音文本数据可获得性。为此,我们的研究提出利用大量仅包含文本的数据集,并通过一种简单直观的文本增强 (TA) 技术对预训练 ASR 模型进行上下文化处理,同时保持计算成本最低。具体而言,为对预训练基于 CIF 的 ASR 进行上下文化,我们使用有限的语音文本数据构建 codebook。通过简单的 codebook 查找过程,将可用的仅文本数据转换为潜在文本嵌入。这些嵌入随后用于增强上下文化 ASR 的输入。我们在多样化的中文测试集上进行实验,证明了 TA 方法显著提升了识别性能。最佳系统在罕见词上的相对 CER 提升最高可达 30%,在所有词上的提升可达 15%。

关键词

引用

@article{arxiv.2406.09950,
  title  = {An efficient text augmentation approach for contextualized Mandarin speech recognition},
  author = {Naijun Zheng and Xucheng Wan and Kai Liu and Ziqing Du and Zhou Huan},
  journal= {arXiv preprint arXiv:2406.09950},
  year   = {2024}
}

备注

accepted to interspeech2024