循环与蒸馏:基于注意力图复用与掩码蒸馏的 Transformer 语音自监督模型通用压缩策略
音频与语音处理
2023-10-27 v2 计算与语言
机器学习
摘要
基于 Transformer 的语音自监督学习(SSL)模型,如 HuBERT,在各种语音处理任务中表现出令人惊讶的性能。然而,语音 SSL 模型中庞大的参数量有必要将其压缩为更紧凑的模型,以便在学术界或小型公司中更广泛地使用。在本研究中,我们建议跨 Transformer 层复用注意力图,从而在保留层数的同时移除键和查询参数。此外,我们提出了一种新颖的掩码蒸馏策略,以提升学生模型的语音表示质量。我们将蒸馏损失扩展为同时利用掩码和未掩码的语音帧,以充分利用教师模型的高质量表示。我们的通用压缩策略所得学生模型在 SUPERB 基准上取得了 7.72% 的音素错误率(PER)和 9.96% 的词错误率(WER)。
引用
@article{arxiv.2305.11685,
title = {Recycle-and-Distill: Universal Compression Strategy for Transformer-based Speech SSL Models with Attention Map Reusing and Masking Distillation},
author = {Kangwook Jang and Sungnyun Kim and Se-Young Yun and Hoirin Kim},
journal= {arXiv preprint arXiv:2305.11685},
year = {2023}
}
备注
Proceedings of Interspeech 2023. Code URL: https://github.com/sungnyun/ARMHuBERT