中文

循环与蒸馏:基于注意力图复用与掩码蒸馏的 Transformer 语音自监督模型通用压缩策略

音频与语音处理 2023-10-27 v2 计算与语言 机器学习

摘要

基于 Transformer 的语音自监督学习(SSL)模型,如 HuBERT,在各种语音处理任务中表现出令人惊讶的性能。然而,语音 SSL 模型中庞大的参数量有必要将其压缩为更紧凑的模型,以便在学术界或小型公司中更广泛地使用。在本研究中,我们建议跨 Transformer 层复用注意力图,从而在保留层数的同时移除键和查询参数。此外,我们提出了一种新颖的掩码蒸馏策略,以提升学生模型的语音表示质量。我们将蒸馏损失扩展为同时利用掩码和未掩码的语音帧,以充分利用教师模型的高质量表示。我们的通用压缩策略所得学生模型在 SUPERB 基准上取得了 7.72% 的音素错误率(PER)和 9.96% 的词错误率(WER)。

关键词

引用

@article{arxiv.2305.11685,
  title  = {Recycle-and-Distill: Universal Compression Strategy for Transformer-based Speech SSL Models with Attention Map Reusing and Masking Distillation},
  author = {Kangwook Jang and Sungnyun Kim and Se-Young Yun and Hoirin Kim},
  journal= {arXiv preprint arXiv:2305.11685},
  year   = {2023}
}

备注

Proceedings of Interspeech 2023. Code URL: https://github.com/sungnyun/ARMHuBERT