OWLS:多语言语音识别与翻译模型的规模定律
计算与语言
2025-02-17 v1 人工智能
机器学习
音频与语音处理
摘要
神经规模定律为设计稳健的序列处理架构提供了宝贵的见解。虽然这些定律在其他模态下已被广泛表征,但在语音领域的行为仍相对不熟悉。本文引入OWLS,一个开放获取、可复现的多语言语音识别和翻译模型套件,参数规模从0.25B扩展至18B,其中18B版本是目前已知最大的语音模型。OWLS利用最高达36万小时的公共语音数据,覆盖150种语言,使我们能够系统性地探讨数据、模型和计算规模如何分别影响多语言语音任务中的性能。我们使用OWLS推导神经规模定律,展示如何可靠地预测规模化后的最终性能。我们的关键发现之一是,规模化提升了对低资源语言/方言的性能,有助于缓解偏见并提高语音技术的可及性。最后,我们表明OWLS可用于 powering 新研究方向,通过发现大规模语音模型中的新兴能力。模型检查点将发布在 https://huggingface.co/collections/espnet/owls-scaling-laws-for-speech-recognition-and-translation-67ab7f991c194065f057ce8d 供后续研究使用。
引用
@article{arxiv.2502.10373,
title = {OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models},
author = {William Chen and Jinchuan Tian and Yifan Peng and Brian Yan and Chao-Han Huck Yang and Shinji Watanabe},
journal= {arXiv preprint arXiv:2502.10373},
year = {2025}
}
备注
23 pages, 13 figures