中文

VietASR:基于50小时标注数据与大规模语音预训练实现工业级越南语ASR

音频与语音处理 2025-05-30 v2 人工智能 计算与语言 声音

摘要

自动语音识别 (Automatic Speech Recognition, ASR) 取得了显著进展,但严重依赖大规模标注数据,而这对于越南语等低资源语言而言十分匮乏。尽管 Whisper、USM 和 MMS 等现有系统取得了不错的性能,但其在训练成本、延迟和可访问性方面的效能仍显不足。为解决这些问题,我们提出了 VietASR,一种利用大量无标注数据和少量标注数据的新型 ASR 训练流程。通过在大规模无标注数据集上进行多次迭代的 ASR 偏置自监督学习,VietASR 为提升 ASR 性能提供了一种经济高效且实用的解决方案。实验表明,在 70,000 小时的无标注数据上进行预训练,并仅在 50 小时的标注数据上进行微调,即可得到一个轻量但强大的 ASR 模型。该模型在真实世界数据上优于 Whisper Large-v3 和商用 ASR 系统。我们将开源代码和模型,以促进低资源 ASR 的研究。

关键词

引用

@article{arxiv.2505.21527,
  title  = {VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining},
  author = {Jianheng Zhuo and Yifan Yang and Yiwen Shao and Yong Xu and Dong Yu and Kai Yu and Xie Chen},
  journal= {arXiv preprint arXiv:2505.21527},
  year   = {2025}
}