中文

UFO2:面向在线与离线语音识别的统一预训练框架

音频与语音处理 2023-04-04 v2 声音

摘要

在本文中,我们提出了一种面向在线与离线自动语音识别(ASR)的统一预训练框架(UFO2),它 1)将在线和离线模式的两个独立训练工作流简化为一个过程,并 2)在有限话语标注下提升了词错率(WER)性能。具体而言,我们将传统的离线模式基于自监督学习(SSL)的 ASR 方法扩展为统一方式,其中模型训练以全上下文输入和动态分块输入为条件。为增强预训练表示模型,应用了停止梯度操作将在线模式的目标与量化器解耦。此外,在预训练和下游微调阶段,均提出了联合损失,以在两种模式间共享全权重的方式训练统一模型。在 LibriSpeech 数据集上的实验结果表明,UFO2 在离线和在线模式下分别实现了 29.7% 和 18.2% 的相对 WER 降低,优于基于 SSL 的基线方法。

关键词

引用

@article{arxiv.2210.14515,
  title  = {UFO2: A unified pre-training framework for online and offline speech recognition},
  author = {Li Fu and Siqi Li and Qingtao Li and Liping Deng and Fangzhu Li and Lu Fan and Meng Chen and Xiaodong He},
  journal= {arXiv preprint arXiv:2210.14515},
  year   = {2023}
}

备注

Accepted by ICASSP 2023