基于Whisper知识蒸馏的快速流式Transducer ASR原型构建
计算与语言
2024-10-10 v2 声音
音频与语音处理
摘要
在很少或没有监督数据的情况下训练自动语音识别(ASR)系统仍然是一个悬而未决的问题。在这项工作中,我们证明了流式Transformer-Transducer(TT)模型可以在消费级和可访问的GPU上,完全使用来自基础语音模型(FSM)的伪标签(PL)语音从头开始训练。这使得仅需一个阶段就能训练出鲁棒的ASR模型,并且与需要预训练和微调的两步方案相比,不需要大量的数据和计算预算。我们对基于PL的流式TT模型的不同方面进行了全面的消融研究,例如以下因素的影响:(1) n-gram语言模型的浅融合,(2) 基于命名实体的上下文偏置,(3) 用于低延迟流式应用的块状解码,以及(4) TT整体性能随FSM大小的变化。我们的结果表明,即使使用非常嘈杂的PL,TT也可以在没有监督数据的情况下从头开始训练。我们在CommonVoice的6种语言上验证了所提出的框架,并提出了多种启发式方法来过滤掉幻觉PL。
引用
@article{arxiv.2409.13499,
title = {Fast Streaming Transducer ASR Prototyping via Knowledge Distillation with Whisper},
author = {Iuliia Thorbecke and Juan Zuluaga-Gomez and Esaú Villatoro-Tello and Shashi Kumar and Pradeep Rangappa and Sergio Burdisso and Petr Motlicek and Karthik Pandia and Aravind Ganapathiraju},
journal= {arXiv preprint arXiv:2409.13499},
year = {2024}
}
备注
Accepted to EMNLP Findings 2024