工业级多语言 ASR 剖析
音频与语音处理
2024-04-17 v2 计算与语言
机器学习
声音
摘要
本文介绍了 AssemblyAI 的工业级自动语音识别(ASR)系统,该系统旨在满足大规模、多语言 ASR 服务各种应用需求。我们的系统利用了包含四种语言的无监督(1250 万小时)、监督(18.8 万小时)和伪标记(160 万小时)数据的多样化训练数据集。我们详细描述了我们的模型架构,该架构由使用 BEST-RQ 预训练的全上下文 6 亿参数 Conformer 编码器和与编码器联合微调的 RNN-T 解码器组成。我们广泛的评估表明,与更大且计算成本更高的模型(如 Whisper large 和 Canary-1B)相比,该系统取得了具有竞争力的词错误率(WER)。此外,我们的架构选择带来了几个关键优势,包括改进的语码转换能力、与优化后的 Whisper 基线相比 5 倍的推理加速、语音数据上幻觉率降低 30%,以及与 Whisper 相比环境噪声减少 90%,同时显著提高了时间戳精度。在整个工作中,我们采用以系统为中心的方法来分析成熟 ASR 模型的各个方面,以获得对大规模运行的现实服务有用的实用见解。
引用
@article{arxiv.2404.09841,
title = {Anatomy of Industrial Scale Multilingual ASR},
author = {Francis McCann Ramirez and Luka Chkhetiani and Andrew Ehrenberg and Robert McHardy and Rami Botros and Yash Khare and Andrea Vanzo and Taufiquzzaman Peyash and Gabriel Oexle and Michael Liang and Ilya Sklyar and Enver Fakhan and Ahmed Etefy and Daniel McCrystal and Sam Flamini and Domenic Donato and Takuya Yoshioka},
journal= {arXiv preprint arXiv:2404.09841},
year = {2024}
}