中文

Omnilingual ASR:面向1600+种语言的开源多语言语音识别

计算与语言 2025-11-14 v1

摘要

自动语音识别(ASR)在高资源语言上取得了进展,但世界上7000多种语言中的大多数仍然不受支持,使数千种长尾语言被抛在后面。扩展ASR覆盖范围一直成本高昂,并受到限制语言支持的架构的制约,使得扩展对大多数人来说难以企及——而在没有社区合作的情况下推进时,又与伦理问题交织在一起。为了超越这些限制,我们引入了Omnilingual ASR,这是首个为可扩展性而设计的大规模ASR系统。Omnilingual ASR使社区能够仅凭少量数据样本引入未被服务的语言。它将自监督预训练扩展到7B参数以学习鲁棒的语音表示,并引入了旨在实现零样本泛化的编码器-解码器架构,利用了受LLM启发的解码器。这一能力建立在海量且多样化的训练语料库之上;通过结合覆盖广度与语言多样性,该模型学习到的表示足够鲁棒,能够适应未见过的语言。通过将公共资源与通过有偿当地合作伙伴关系收集的社区录音相结合,Omnilingual ASR将覆盖范围扩展到1600多种语言,这是迄今为止规模最大的此类努力——包括超过500种以前从未被ASR服务过的语言。自动评估表明,相较于先前的系统有实质性提升,尤其是在低资源条件下,并表现出强大的泛化能力。我们将Omnilingual ASR作为一系列模型发布,从用于低功耗设备的300M变体到用于最高准确率的7B变体。我们反思了塑造这一设计的伦理考量,并在最后讨论了其社会影响。特别是,我们强调了开源模型和工具如何能够降低研究人员和社区的门槛,从而促成新的参与形式。开源工件可在https://github.com/facebookresearch/omnilingual-asr获取。

关键词

引用

@article{arxiv.2511.09690,
  title  = {Omnilingual ASR: Open-Source Multilingual Speech Recognition for 1600+ Languages},
  author = {Omnilingual ASR team and Gil Keren and Artyom Kozhevnikov and Yen Meng and Christophe Ropers and Matthew Setzler and Skyler Wang and Ife Adebara and Michael Auli and Can Balioglu and Kevin Chan and Chierh Cheng and Joe Chuang and Caley Droof and Mark Duppenthaler and Paul-Ambroise Duquenne and Alexander Erben and Cynthia Gao and Gabriel Mejia Gonzalez and Kehan Lyu and Sagar Miglani and Vineel Pratap and Kaushik Ram Sadagopan and Safiyyah Saleem and Arina Turkatenko and Albert Ventayol-Boada and Zheng-Xin Yong and Yu-An Chung and Jean Maillard and Rashel Moritz and Alexandre Mourachko and Mary Williamson and Shireen Yates},
  journal= {arXiv preprint arXiv:2511.09690},
  year   = {2025}
}