面向ASR领域泛化的精英采样与集成知识蒸馏方法
音频与语音处理
2023-03-02 v1 声音
摘要
知识蒸馏已广泛用于语音应用的模型压缩与领域自适应。在存在多个教师模型时,通过对模型输出取平均可轻易将知识迁移至学生模型。然而,已有研究表明学生模型对此类组合适应不佳。本文提出在集成教师模型输出处采用精英采样策略,选取由完全域外教师模型生成的最佳解码语句,以实现对未见领域的泛化。教师模型在AMI、LibriSpeech和WSJ上训练,而学生模型针对Switchboard数据自适应。结果表明,基于各模型后验概率的选择策略使学生模型的词错率(WER)优于所有教师模型与基线,最低绝对提升约8.4%。此外,还通过相关性分析研究了利用域外数据进行模型自适应的内在机理。
引用
@article{arxiv.2303.00550,
title = {Towards domain generalisation in ASR with elitist sampling and ensemble knowledge distillation},
author = {Rehan Ahmad and Md Asif Jalal and Muhammad Umar Farooq and Anna Ollerenshaw and Thomas Hain},
journal= {arXiv preprint arXiv:2303.00550},
year = {2023}
}