中文

面向ASR领域泛化的精英采样与集成知识蒸馏方法

音频与语音处理 2023-03-02 v1 声音

摘要

知识蒸馏已广泛用于语音应用的模型压缩与领域自适应。在存在多个教师模型时,通过对模型输出取平均可轻易将知识迁移至学生模型。然而,已有研究表明学生模型对此类组合适应不佳。本文提出在集成教师模型输出处采用精英采样策略,选取由完全域外教师模型生成的最佳解码语句,以实现对未见领域的泛化。教师模型在AMI、LibriSpeech和WSJ上训练,而学生模型针对Switchboard数据自适应。结果表明,基于各模型后验概率的选择策略使学生模型的词错率(WER)优于所有教师模型与基线,最低绝对提升约8.4%。此外,还通过相关性分析研究了利用域外数据进行模型自适应的内在机理。

关键词

引用

@article{arxiv.2303.00550,
  title  = {Towards domain generalisation in ASR with elitist sampling and ensemble knowledge distillation},
  author = {Rehan Ahmad and Md Asif Jalal and Muhammad Umar Farooq and Anna Ollerenshaw and Thomas Hain},
  journal= {arXiv preprint arXiv:2303.00550},
  year   = {2023}
}