通过自适应两阶段知识蒸馏缩小基于Transducer的流式与非流式语音识别差距
计算与语言
2023-06-28 v1
摘要
Transducer是流式语音识别的主流框架之一。由于上下文有限,流式与非流式transducer模型间存在性能差距。为缩小该差距,一种有效方式是确保其隐层与输出分布一致,这可通过分层知识蒸馏实现。然而,由于输出分布的学习依赖于隐层分布,难以同时保证分布一致性。本文提出一种由隐层学习与输出层学习组成的自适应两阶段知识蒸馏方法。前一阶段中,我们应用均方误差损失函数以全上下文学习隐层表示;后一阶段中,设计基于幂变换的自适应平滑方法学习稳定输出分布。在LibriSpeech语料库上,其相对词错率降低19%,且相比原始流式模型首令牌响应更快。
引用
@article{arxiv.2306.15171,
title = {Reducing the gap between streaming and non-streaming Transducer-based ASR by adaptive two-stage knowledge distillation},
author = {Haitao Tang and Yu Fu and Lei Sun and Jiabin Xue and Dan Liu and Yongchao Li and Zhiqiang Ma and Minghui Wu and Jia Pan and Genshun Wan and Ming'en Zhao},
journal= {arXiv preprint arXiv:2306.15171},
year = {2023}
}