STaR:为轻量级语音自监督学习模型蒸馏语音时序关系
声音
2024-04-26 v2 计算与语言
音频与语音处理
摘要
尽管基于 Transformer 的语音自监督学习(SSL)模型性能优异,但其庞大的参数量和计算成本使其难以被利用。在本研究中,我们提出通过蒸馏语音时序关系(STaR)来压缩语音 SSL 模型。与以往直接匹配每个语音帧表示的工作不同,STaR 蒸馏传递语音帧之间的时序关系,这更适合容量有限的轻量级学生模型。我们探索了三种 STaR 蒸馏目标,并选择最佳组合作为最终的 STaR 损失。我们从 HuBERT BASE 蒸馏的模型在 SUPERB 基准上取得了 79.8 的总分,在参数量不超过 2700 万的模型中表现最佳。我们表明,我们的方法适用于不同的语音 SSL 模型,并且在进一步减少参数的情况下仍能保持稳健的性能。
引用
@article{arxiv.2312.09040,
title = {STaR: Distilling Speech Temporal Relation for Lightweight Speech Self-Supervised Learning Models},
author = {Kangwook Jang and Sungnyun Kim and Hoirin Kim},
journal= {arXiv preprint arXiv:2312.09040},
year = {2024}
}
备注
ICASSP 2024 Best Student Paper Awarded. Code URL: https://github.com/sungnyun/ARMHuBERT