中文

更小是否总是更快?自监督语音 Transformer 压缩中的权衡

计算与语言 2025-08-19 v4 机器学习 声音 音频与语音处理

摘要

基于 Transformer 的自监督模型在语音处理中取得了显著成功,但其庞大的规模和较高的推理成本给实际部署带来了重大挑战。尽管已提出众多压缩技术,不一致的评估指标使得难以比较它们的实际效果。本文对四种常见压缩方法进行了全面研究,包括权重剪枝、注意力头剪枝、低秩近似以及针对自监督语音 Transformer 的知识蒸馏。我们在三个关键指标下评估每种方法:参数量、乘加运算次数和实时因子。结果表明每种方法各有优势。此外,我们在同一框架下梳理了近期压缩技术,比较了 DistilHuBERT、FitHuBERT、LightHuBERT、ARMHuBERT 和 STaRHuBERT,为部署中的压缩提供实用指导。

关键词

引用

@article{arxiv.2211.09949,
  title  = {Is Smaller Always Faster? Tradeoffs in Compressing Self-Supervised Speech Transformers},
  author = {Tzu-Quan Lin and Tsung-Huan Yang and Chun-Yao Chang and Kuang-Ming Chen and Tzu-hsun Feng and Hung-yi Lee and Hao Tang},
  journal= {arXiv preprint arXiv:2211.09949},
  year   = {2025}
}

备注

Accepted at ASRU 2025. Code is available at https://github.com/nervjack2/Speech-SSL-Compression