中文

利用辅助非流式层实现从非流式到流式 ASR 编码器的知识蒸馏

计算与语言 2023-09-01 v1 音频与语音处理

摘要

流式自动语音识别(ASR)模型被限制访问未来上下文,这导致其性能劣于非流式模型。为提升流式 ASR 性能,已有研究探讨从非流式模型向流式模型进行知识蒸馏(KD),主要集中于对齐输出词元概率。本文提出一种从教师编码器到学生编码器的逐层 KD。为确保使用相同上下文提取特征,我们在学生网络中插入辅助非流式分支,并从非流式教师层向非流式辅助层执行 KD。我们设计了一种特殊的 KD 损失,利用自回归预测编码(APC)机制促使流式模型预测未见过的未来上下文。实验结果表明,与先前的词元概率蒸馏方法相比,所提方法能显著降低词错误率。

关键词

引用

@article{arxiv.2308.16415,
  title  = {Knowledge Distillation from Non-streaming to Streaming ASR Encoder using Auxiliary Non-streaming Layer},
  author = {Kyuhong Shim and Jinkyu Lee and Simyung Chang and Kyuwoong Hwang},
  journal= {arXiv preprint arXiv:2308.16415},
  year   = {2023}
}

备注

Accepted to Interspeech 2023