Delayed-KD:面向低延迟流式 ASR 的基于延迟知识蒸馏的 CTC
声音
2025-05-29 v1 音频与语音处理
摘要
基于 CTC 的流式 ASR 在实际应用中受到了广泛关注,但面临两个主要挑战:小块中的准确性下降和 token 发射延迟。为了缓解这些挑战,我们提出了 Delayed-KD,它将 CTC 后验概率上的延迟知识蒸馏从非流式模型应用于流式模型。具体而言,在极小块尺寸下,我们引入了一个时间对齐缓冲区(TAB),它定义了与非流式教师模型相比的相对延迟范围,以对齐 CTC 输出并缓解非空白 token 不匹配。此外,TAB 能够对 token 发射延迟进行细粒度控制。在 178 小时的 AISHELL-1 和 10,000 小时的 WenetSpeech 普通话数据集上的实验表明了 Delayed-KD 的一致优越性。令人印象深刻的是,在 40 ms 延迟下的 Delayed-KD 在 AISHELL-1 上实现了 5.42% 的较低字符错误率(CER),可与在 320 ms 延迟下运行的具有竞争力的 U2++ 模型相媲美。
引用
@article{arxiv.2505.22069,
title = {Delayed-KD: Delayed Knowledge Distillation based CTC for Low-Latency Streaming ASR},
author = {Longhao Li and Yangze Li and Hongfei Xue and Jie Liu and Shuai Fang and Kai Wang and Lei Xie},
journal= {arXiv preprint arXiv:2505.22069},
year = {2025}
}
备注
Accepted by Interspeech2025