面向长音频转写的端到端ASR架构研究
音频与语音处理
2023-09-22 v2 声音
摘要
本文概述并评估了一些用于长音频的端到端ASR模型。我们基于核心架构将自动语音识别(ASR)模型分为三类:(1)卷积式,(2)带挤压激励的卷积式,以及(3)带注意力的卷积式。我们从每类中选取一个ASR模型,并在多种长音频基准(Earnings-21和22、CORAAL以及TED-LIUM3)上评估了每个模型的词错误率、最大音频长度和实时因子。具有局部注意力与全局token的自注意力类模型相较于其他架构具有最佳准确率。我们还比较了采用CTC和RNNT解码器的模型,表明在长音频上基于CTC的模型比RNNT更鲁棒且更高效。
引用
@article{arxiv.2309.09950,
title = {Investigating End-to-End ASR Architectures for Long Form Audio Transcription},
author = {Nithin Rao Koluguri and Samuel Kriman and Georgy Zelenfroind and Somshubra Majumdar and Dima Rekesh and Vahid Noroozi and Jagadeesh Balam and Boris Ginsburg},
journal= {arXiv preprint arXiv:2309.09950},
year = {2023}
}
备注
PrePrint. Submitted to ICASSP 2024