中文

改进非目标域数据上噪声学生训练用于自动语音识别

声音 2023-03-02 v2 计算与语言 音频与语音处理

摘要

噪声学生训练(Noisy Student Training, NST)近期在自动语音识别(ASR)中展现出极强的性能。本文中,我们提出一种名为 LM Filter 的数据筛选策略,以改进 NST 在非目标域数据上 ASR 任务中的表现。我们生成带语言模型与不带语言模型的假设,并利用它们之间的 CER 差异作为筛选阈值。结果显示,与无数据筛选基线相比有 10.4% 的显著提升。我们在 AISHELL-1 测试集上可达到 3.31% 的 CER,据我们所知这是未使用任何其他有监督数据的最佳结果。我们还在有监督的 1000 小时 AISHELL-2 数据集上进行了评估,可达到 4.73% CER 的竞争性结果。

关键词

引用

@article{arxiv.2211.04717,
  title  = {Improving Noisy Student Training on Non-target Domain Data for Automatic Speech Recognition},
  author = {Yu Chen and Wen Ding and Junjie Lai},
  journal= {arXiv preprint arXiv:2211.04717},
  year   = {2023}
}

备注

This paper is accepted by the ICASSP 2023 conference