StableQuant:面向语音基础模型的分层自适应后训练量化
音频与语音处理
2025-04-22 v1 人工智能
摘要
本文提出 StableQuant,这是一种用于广泛应用语音基础模型(SFMs)的新型自适应后训练量化(PTQ)算法。虽然 PTQ 已成功应用于压缩大型语言模型(LLM),以规避额外的微调,但直接将这些技术应用于 SFMs 可能并非能获得最佳结果,因为 SFMs 使用用于特征提取的不同网络结构。StableQuant 能在不考虑网络结构类型的前提下实现最佳量化性能,方法是通过分析尺度分布和整体性能,自适应确定每个层的量化范围。我们在两个 SFMs 上进行评估:HuBERT 和 wav2vec2.0,用于自动语音识别(ASR)任务,实现了优于传统 PTQ 方法的优异性能。StableQuant 成功将 SFM 模型的大小缩减为四分之一,同时将推理速度翻倍,且以 8 位量化方式将词错误率(WER)性能下降限制在 0.3% 以下。
引用
@article{arxiv.2504.14915,
title = {StableQuant: Layer Adaptive Post-Training Quantization for Speech Foundation Models},
author = {Yeona Hong and Hyewon Han and Woo-jin Chung and Hong-Goo Kang},
journal= {arXiv preprint arXiv:2504.14915},
year = {2025}
}
备注
Accepted at ICASSP 2025