中文

在代码切换语音识别中进行知识蒸馏时不遗漏任何知识:面向实际数据的有效且实用的知识蒸馏方法

音频与语音处理 2024-07-16 v1 计算与语言 声音

摘要

近期的自动语音识别 (ASR) 进展常常依赖于大型语音基础模型以生成高质量的转录文本。然而,这些模型由于计算资源有限,往往难以实际应用。这种情况在更现实或更具挑战性的场景中尤为突出,如代码切换语音识别 (CS-ASR)。为此,我们提出了一个利用真实语音数据进行知识蒸馏,以开发更高效模型的框架,用于 CS-ASR。我们提出的方法称为利用知识蒸馏时不遗漏任何知识 (K2^2D),该方法综合运用了教师模型的知识以及来自小型辅助模型的额外见解。我们在两个域内数据集和两个域外数据集上进行评估,证明 K2^2D 方法有效。通过在未标记的真实数据上进行 K2^2D,我们成功地获得了一个模型体积为原来的 1/2,生成速度提升约 5 倍,同时在所有测试集上均优于基线方法和教师模型。我们已将模型公开发布在 Hugging Face 上(https://huggingface.co/andybi7676/k2d-whisper.zh-en)。

关键词

引用

@article{arxiv.2407.10603,
  title  = {Leave No Knowledge Behind During Knowledge Distillation: Towards Practical and Effective Knowledge Distillation for Code-Switching ASR Using Realistic Data},
  author = {Liang-Hsuan Tseng and Zih-Ching Chen and Wei-Shun Chang and Cheng-Kuang Lee and Tsung-Ren Huang and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2407.10603},
  year   = {2024}
}