中文

面向自动语音识别的统一半监督管线

音频与语音处理 2025-06-10 v1

摘要

自动语音识别是一项长期的研究领域,致力于整合半监督学习以应对标注数据稀缺的挑战。然而,大多数 prior work 仅聚焦于利用现有数据集改进学习算法,缺乏面向新数据集或新语言的完整公开框架。本文我们引入了全开源的半监督训练框架,涵盖整个管线:从无标签数据收集到伪标注再到模型训练。我们的methods方法 enables 使用基于创意公共许可证的公开语音数据为任何语言扩展可扩展的数据集创建。我们还提出了一种新颖的伪标注算法 TopIPL,并在低资源(葡萄牙语、亚美尼亚语)和高资源(西班牙语)环境中进行评估。值得注意的是,TopIPL 在葡萄牙语上实现了 18-40% 的相对 WER 改善,在亚美尼亚语上实现了 5-16% 的改善,在西班牙语上实现了 2-8% 的改善。

关键词

引用

@article{arxiv.2506.07659,
  title  = {Unified Semi-Supervised Pipeline for Automatic Speech Recognition},
  author = {Nune Tadevosyan and Nikolay Karpov and Andrei Andrusenko and Vitaly Lavrukhin and Ante Jukic},
  journal= {arXiv preprint arXiv:2506.07659},
  year   = {2025}
}

备注

Accepted to Interspeech 2025