中文

深与宽:自监督语音模型任务无关知识蒸馏的学生架构分析

计算与语言 2022-09-02 v2 声音 音频与语音处理

摘要

自监督学习(SSL)因在多项语音下游任务上的高性能而被视为一种非常有前景的方法。由于SSL模型的参数通常十分庞大,训练与推理需要大量内存和计算成本,因此期望通过应用知识蒸馏(KD)等压缩方法在不显著退化性能的前提下产出紧凑的SSL模型。尽管KD方法能够缩减SSL模型结构的深度和/或宽度,但关于深度和宽度变化如何影响小足迹模型内部表示的研究甚少。本文提供了一种解决该问题的实证研究。我们在保持参数量不变的前提下改变结构与KD方法,研究SUPERB上的性能;这使我们能分析由改变模型架构所引入表示的贡献。实验表明,一定的深度对于准确解决内容导向任务(如自动语音识别)至关重要,而一定的宽度对于在若干说话人导向任务(如说话人识别)上取得高性能是必要的。基于这些观察,我们为SUPERB确定了一个比既往研究性能更好且更压缩的模型。

关键词

引用

@article{arxiv.2207.06867,
  title  = {Deep versus Wide: An Analysis of Student Architectures for Task-Agnostic Knowledge Distillation of Self-Supervised Speech Models},
  author = {Takanori Ashihara and Takafumi Moriya and Kohei Matsuura and Tomohiro Tanaka},
  journal= {arXiv preprint arXiv:2207.06867},
  year   = {2022}
}

备注

Accepted at Interspeech 2022