改进非目标域数据上噪声学生训练用于自动语音识别
声音
2023-03-02 v2 计算与语言
音频与语音处理
摘要
噪声学生训练(Noisy Student Training, NST)近期在自动语音识别(ASR)中展现出极强的性能。本文中,我们提出一种名为 LM Filter 的数据筛选策略,以改进 NST 在非目标域数据上 ASR 任务中的表现。我们生成带语言模型与不带语言模型的假设,并利用它们之间的 CER 差异作为筛选阈值。结果显示,与无数据筛选基线相比有 10.4% 的显著提升。我们在 AISHELL-1 测试集上可达到 3.31% 的 CER,据我们所知这是未使用任何其他有监督数据的最佳结果。我们还在有监督的 1000 小时 AISHELL-2 数据集上进行了评估,可达到 4.73% CER 的竞争性结果。
引用
@article{arxiv.2211.04717,
title = {Improving Noisy Student Training on Non-target Domain Data for Automatic Speech Recognition},
author = {Yu Chen and Wen Ding and Junjie Lai},
journal= {arXiv preprint arXiv:2211.04717},
year = {2023}
}
备注
This paper is accepted by the ICASSP 2023 conference