利用辅助非流式层实现从非流式到流式 ASR 编码器的知识蒸馏
计算与语言
2023-09-01 v1 音频与语音处理
摘要
流式自动语音识别(ASR)模型被限制访问未来上下文,这导致其性能劣于非流式模型。为提升流式 ASR 性能,已有研究探讨从非流式模型向流式模型进行知识蒸馏(KD),主要集中于对齐输出词元概率。本文提出一种从教师编码器到学生编码器的逐层 KD。为确保使用相同上下文提取特征,我们在学生网络中插入辅助非流式分支,并从非流式教师层向非流式辅助层执行 KD。我们设计了一种特殊的 KD 损失,利用自回归预测编码(APC)机制促使流式模型预测未见过的未来上下文。实验结果表明,与先前的词元概率蒸馏方法相比,所提方法能显著降低词错误率。
引用
@article{arxiv.2308.16415,
title = {Knowledge Distillation from Non-streaming to Streaming ASR Encoder using Auxiliary Non-streaming Layer},
author = {Kyuhong Shim and Jinkyu Lee and Simyung Chang and Kyuwoong Hwang},
journal= {arXiv preprint arXiv:2308.16415},
year = {2023}
}
备注
Accepted to Interspeech 2023