中文

GigaAM:用于语音识别的高效自监督学习器

音频与语音处理 2025-06-03 v1 声音

摘要

自监督学习 (Self-Supervised Learning, SSL) 在语音处理中展现出了强大的性能,尤其是在自动语音识别方面。在本文中,我们探索了一种 SSL 预训练框架,该框架利用掩码语言建模,其目标派生自语音识别模型。我们还提出了在预训练期间采用动态块大小采样的分块注意力,以同时支持全上下文和流式微调。我们的实验考察了模型规模和数据量方面的缩放表现。使用我们的方法,我们训练了 GigaAM 系列模型,其中包括一个用于俄语语音识别的最先进模型,其性能比 Whisper-large-v3 高出 50%。我们已根据 MIT 许可证将基础模型和 ASR 模型以及推理代码作为开源资源发布给研究社区。可在 https://github.com/salute-developers/gigaam 获取。

关键词

引用

@article{arxiv.2506.01192,
  title  = {GigaAM: Efficient Self-Supervised Learner for Speech Recognition},
  author = {Aleksandr Kutsakov and Alexandr Maximenko and Georgii Gospodinov and Pavel Bogomolov and Fyodor Minkin},
  journal= {arXiv preprint arXiv:2506.01192},
  year   = {2025}
}

备注

Accepted to Interspeech 2025