中文

OLMoASR:用于训练鲁棒语音识别模型的开放模型与数据

声音 2025-08-29 v1 计算与语言 机器学习 音频与语音处理

摘要

训练数据规模和质量的提升带来了显著进步,但其在语音识别中的影响仍未得到充分探索。本文提出了一个大规模数据集 OLMoASR-Pool,以及一系列模型 OLMoASR,用于研究和开发鲁棒的零样本语音识别模型。从 OLMoASR-Pool 开始,这是一个包含 300 万小时英语音频和 1700 万段转录文本的集合,我们设计了文本启发式过滤器以删除低质量或转录错误的数据。我们的 curated 流程产生一个包含 100 万小时高质量音频-转录对的新数据集,称为 OLMoASR-Mix。我们使用 OLMoASR-Mix 训练 OLMoASR-Mix 模型系列,参数规模从 3900 万(tiny.en)到 15 亿(large.en)不等。在所有模型规模上,OLMoASR 在短时和长时语音识别基准测试中实现与 OpenAI Whisper 相当的平均性能。值得注意的是,OLMoASR-medium.en 达到 12.8% 和 11.0% 的词错误率(WER),与 Whisper 最大的英语专用模型 Whisper-medium.en 的 12.4% 和 10.5% WER 在短时和长时识别中相当(参数数量相当)。OLMoASR-Pool、OLMoASR 模型以及过滤、训练和评估代码将公开释放,以进一步推动鲁棒语音处理研究。

关键词

引用

@article{arxiv.2508.20869,
  title  = {OLMoASR: Open Models and Data for Training Robust Speech Recognition Models},
  author = {Huong Ngo and Matt Deitke and Martijn Bartelds and Sarah Pratt and Josh Gardner and Matt Jordan and Ludwig Schmidt},
  journal= {arXiv preprint arXiv:2508.20869},
  year   = {2025}
}

备注

17 pages, 7 figures