通过多码本向量量化知识蒸馏提升全格式端到端语音识别
音频与语音处理
2025-12-23 v1
摘要
传统的自动语音识别(ASR)模型通常产生归一化文本,缺少标点和大小写, necessitating 后处理模型来提高可读性。然而,这种方法由于级联系统设计引入了额外的复杂性和延迟。针对这一挑战,越来越多的人开始开发能够直接预测标点和大小写的端到端(E2E)ASR 模型,尽管这一领域仍未得到充分探索。本文提出了一种通过多码本向量量化(MVQ)知识蒸馏(KD)所实现的增强型全格式 E2E ASR 模型。实验结果表明,我们的模型在带和不带标点和大小写的词错误率(WER)以及标点错误率(PER)方面均显著优于先前的工作。在 LibriSpeech-PC test-clean 和 test-other 子集上的评估显示,我们的模型实现了最新的成果。
引用
@article{arxiv.2512.18967,
title = {Enhancing Fully Formatted End-to-End Speech Recognition with Knowledge Distillation via Multi-Codebook Vector Quantization},
author = {Jian You and Xiangfeng Li and Erwan Zerhouni},
journal= {arXiv preprint arXiv:2512.18967},
year = {2025}
}
备注
Accepted to ASRU 2025