中文

改进低资源语言端到端语音识别中使用CycleGAN和跨域损失的噪声学生训练

计算与语言 2024-08-01 v1 声音 音频与语音处理

摘要

使用噪声学生训练进行半监督端到端语音识别系统的训练显著提高了性能。然而,这种方法需要大量的成对语音-文本数据和未标记的语音数据,这对于低资源语言来说成本较高。因此,本文考虑更极端的半监督端到端自动语音识别场景,其中仅有有限的成对语音-文本、未标记语音(不足五小时)以及丰富的外部文本。首先,我们通过仅使用外部文本训练模型,发现通过我们之前的工作“CycleGAN和跨域损失”进行半监督学习可获得更好的性能。其次,我们通过纳入自动超参数调优,增强了“CycleGAN和跨域损失”,称为“增强CycleGAN跨域损失”。最后,我们将其集成到面向低资源场景的噪声学生训练方法流程中。我们的实验结果在Voxforge和Common Voice上的六种非英语语言上表明,相对于基线教师模型实现了20%的词错误率降低,相对于基线最佳学生模型实现了10%的词错误率降低,突显了我们所提出方法取得的显著性改进。

关键词

引用

@article{arxiv.2407.21061,
  title  = {Improving noisy student training for low-resource languages in End-to-End ASR using CycleGAN and inter-domain losses},
  author = {Chia-Yu Li and Ngoc Thang Vu},
  journal= {arXiv preprint arXiv:2407.21061},
  year   = {2024}
}

备注

10 pages (2 for references), 4 figures, published in SIGUL2024@LREC-COLING 2024