中文

提升蒸馏自监督语音处理模型在失真环境下的泛化能力

声音 2022-10-21 v2 计算与语言 音频与语音处理

摘要

自监督学习(SSL)的语音预训练模型在各种语音处理任务上表现良好。蒸馏版 SSL 模型已被开发以匹配设备端语音应用的需求。尽管与原始 SSL 模型性能相近,蒸馏模型在失真环境中性能下降比其原始版本更为严重。本文提出在知识蒸馏过程中对 SSL 模型应用跨失真映射与域对抗训练,以缓解由域失配问题引起的性能差距。结果表明,在不同下游任务下,无论是域内还是域外失真设置,均取得一致的性能提升,同时保持了高效的模型规模。

关键词

引用

@article{arxiv.2210.07978,
  title  = {Improving generalizability of distilled self-supervised speech processing models under distorted settings},
  author = {Kuan-Po Huang and Yu-Kuan Fu and Tsu-Yuan Hsu and Fabian Ritter Gutierrez and Fan-Lin Wang and Liang-Hsuan Tseng and Yu Zhang and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2210.07978},
  year   = {2022}
}

备注

Accepted by IEEE SLT2022