中文

SpeechBrain 1.0:开源对话式 AI

机器学习 2024-11-11 v5 人工智能 计算与语言 人机交互 音频与语音处理

摘要

SpeechBrain 是一个基于 PyTorch 的开源对话式 AI 工具包,特别关注语音处理任务,如语音识别、语音增强、说话人识别、文本转语音等。它通过发布预训练模型以及用于训练它们的完整“配方”代码和算法,推动透明度和可复制性。本文介绍了 SpeechBrain 1.0,这是该工具包演进的重要里程碑,现已拥有超过 200 个用于语音、音频和语言处理任务的配方,超过 100 个模型可在 Hugging Face 上获取。SpeechBrain 1.0 引入了支持多样学习模态的新技术,集成大型语言模型(LLM),以及先进的解码策略,同时包括新模型、任务和模态。它还包括一个新的基准存储库,为研究人员提供了一个跨越多样任务的统一模型评估平台。

关键词

引用

@article{arxiv.2407.00463,
  title  = {Open-Source Conversational AI with SpeechBrain 1.0},
  author = {Mirco Ravanelli and Titouan Parcollet and Adel Moumen and Sylvain de Langen and Cem Subakan and Peter Plantinga and Yingzhi Wang and Pooneh Mousavi and Luca Della Libera and Artem Ploujnikov and Francesco Paissan and Davide Borra and Salah Zaiem and Zeyu Zhao and Shucong Zhang and Georgios Karakasidis and Sung-Lin Yeh and Pierre Champion and Aku Rouhe and Rudolf Braun and Florian Mai and Juan Zuluaga-Gomez and Seyed Mahed Mousavi and Andreas Nautsch and Ha Nguyen and Xuechen Liu and Sangeet Sagar and Jarod Duret and Salima Mdhaffar and Gaelle Laperriere and Mickael Rouvier and Renato De Mori and Yannick Esteve},
  journal= {arXiv preprint arXiv:2407.00463},
  year   = {2024}
}

备注

Accepted to the Journal of Machine Learning research (JMLR), Machine Learning Open Source Software