中文

OWSM v3.1:基于 E-Branchformer 的更优更快的开放式 Whisper 风格语音模型

计算与语言 2024-08-28 v3 音频与语音处理

摘要

近期研究凸显了完全开放基础模型的重要性。开放 Whisper 风格语音模型 (OWSM) 是使用公开数据和开源工具包复现 OpenAI Whisper 的初步尝试。然而,OWSM 的先前版本(v1 至 v3)仍基于标准 Transformer,这可能导致其性能逊于最先进的语音编码器架构。本工作旨在在不增加额外数据的情况下提升 OWSM 的性能与效率。我们提出了一系列基于 E-Branchformer 的模型,命名为 OWSM v3.1,参数规模从 1 亿到 10 亿不等。OWSM v3.1 在大多数评估基准上优于其前身 OWSM v3,同时推理速度提升高达 25%。我们进一步揭示了 OWSM v3.1 在零样本上下文偏置语音识别中的涌现能力。我们还提供了一个在低许可限制的数据子集上训练的模型。我们将公开发布代码、预训练模型和训练日志。

关键词

引用

@article{arxiv.2401.16658,
  title  = {OWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer},
  author = {Yifan Peng and Jinchuan Tian and William Chen and Siddhant Arora and Brian Yan and Yui Sudo and Muhammad Shakeel and Kwanghee Choi and Jiatong Shi and Xuankai Chang and Jee-weon Jung and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2401.16658},
  year   = {2024}
}

备注

Accepted at INTERSPEECH 2024. Webpage: https://www.wavlab.org/activities/2024/owsm/