中文

基于自回归生成模型的预训练语言模型蒸馏:GenDistiller

音频与语音处理 2024-06-24 v2 计算与语言 声音

摘要

预训练语音语言模型如 HuBERT 和 WavLM 利用无标签语音数据进行自监督学习,为诸多下游任务提供强大的表示。尽管这些模型取得了成功,但它们对内存和计算资源的高要求阻碍了在资源受限设备上的应用。因此,本文引入了 GenDistiller,这是一个新型的知识蒸馏框架,通过一个 significantly smaller 的学生网络直接生成预训练教师模型的隐藏表示。该方法将前一隐藏层作为历史,并按层自回归预测教师模型。在 SUPERB 上的实验表明,GenDistiller 在没有自回归框架的基线蒸馏方法之上具有优势,参数数量减少 33%,时间消耗相似,且在大多数 SUPERB 任务上性能更好。最终,本文提出的 GenDistiller 将 WavLM 的大小缩小了 82%。

关键词

引用

@article{arxiv.2406.09444,
  title  = {GenDistiller: Distilling Pre-trained Language Models based on an Autoregressive Generative Model},
  author = {Yingying Gao and Shilei Zhang and Chao Deng and Junlan Feng},
  journal= {arXiv preprint arXiv:2406.09444},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2310.13418