中文

OWSM-CTC: 用于语音识别、翻译和语言识别的开放编码器-仅语音基础模型

计算与语言 2024-08-28 v3 声音 音频与语音处理

摘要

近年来,人们对能够在一个模型中执行多项任务的大型语音模型越来越感兴趣。这类模型通常采用编码器-解码器或仅解码器架构,因为它们在许多领域广受欢迎且性能良好。然而,自回归模型在推理时可能比非自回归模型慢,并且存在幻觉的潜在风险。尽管先前的研究观察到非自回归模型在小规模特定任务上取得了有希望的结果,但尚不清楚它们能否扩展到多种语言和任务的语音到文本生成。受开放Whisper风格语音模型(OWSM)项目的启发,我们提出了OWSM-CTC,一种基于连接主义时序分类(CTC)的新型编码器-仅语音基础模型。它在18万小时的公共音频数据上训练,用于多语言自动语音识别(ASR)、语音翻译(ST)和语言识别(LID)。与编码器-解码器OWSM相比,我们的OWSM-CTC在ASR上取得了有竞争力的结果,在ST上取得了高达24%的相对改进,同时推理更加鲁棒且速度快3到4倍。OWSM-CTC还以20倍加速改进了长语音ASR结果。我们将公开发布代码、预训练模型和训练日志,以促进语音基础模型领域的开放科学。

关键词

引用

@article{arxiv.2402.12654,
  title  = {OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification},
  author = {Yifan Peng and Yui Sudo and Muhammad Shakeel and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2402.12654},
  year   = {2024}
}

备注

Accepted at ACL 2024 main conference