中文

探索在公开语音识别语料库上训练的纯解码器模型的极限

计算与语言 2024-02-02 v1 声音 音频与语音处理

摘要

工业级语音识别(ASR)模型(如Whisper和USM)分别基于1M小时的弱标注数据和12M小时的纯音频专有数据训练,其出现引发了对大规模公开ASR语料库和具有竞争力的开源流水线的更强需求。与上述模型不同,大型语言模型通常基于Transformer解码器,目前尚不清楚仅在公开数据上训练的纯解码器模型是否能提供具有竞争力的性能。在本研究中,我们调查了仅使用公开英语ASR语料库获得最佳性能所需的训练数据集选择和建模组件等因素。我们的用于ASR的纯解码器Transformer(DOTA)模型在几乎所有英语ASR基准上全面优于Whisper的编码器-解码器开源复制品(OWSM),并在15个测试集中的7个上优于Whisper large-v3。我们在宽松许可下发布了代码库和模型检查点。

关键词

引用

@article{arxiv.2402.00235,
  title  = {Exploring the limits of decoder-only models trained on public speech recognition corpora},
  author = {Ankit Gupta and George Saon and Brian Kingsbury},
  journal= {arXiv preprint arXiv:2402.00235},
  year   = {2024}
}