中文

基于Whisper知识蒸馏的快速流式Transducer ASR原型构建

计算与语言 2024-10-10 v2 声音 音频与语音处理

摘要

在很少或没有监督数据的情况下训练自动语音识别(ASR)系统仍然是一个悬而未决的问题。在这项工作中,我们证明了流式Transformer-Transducer(TT)模型可以在消费级和可访问的GPU上,完全使用来自基础语音模型(FSM)的伪标签(PL)语音从头开始训练。这使得仅需一个阶段就能训练出鲁棒的ASR模型,并且与需要预训练和微调的两步方案相比,不需要大量的数据和计算预算。我们对基于PL的流式TT模型的不同方面进行了全面的消融研究,例如以下因素的影响:(1) n-gram语言模型的浅融合,(2) 基于命名实体的上下文偏置,(3) 用于低延迟流式应用的块状解码,以及(4) TT整体性能随FSM大小的变化。我们的结果表明,即使使用非常嘈杂的PL,TT也可以在没有监督数据的情况下从头开始训练。我们在CommonVoice的6种语言上验证了所提出的框架,并提出了多种启发式方法来过滤掉幻觉PL。

关键词

引用

@article{arxiv.2409.13499,
  title  = {Fast Streaming Transducer ASR Prototyping via Knowledge Distillation with Whisper},
  author = {Iuliia Thorbecke and Juan Zuluaga-Gomez and Esaú Villatoro-Tello and Shashi Kumar and Pradeep Rangappa and Sergio Burdisso and Petr Motlicek and Karthik Pandia and Aravind Ganapathiraju},
  journal= {arXiv preprint arXiv:2409.13499},
  year   = {2024}
}

备注

Accepted to EMNLP Findings 2024