为多数展开少数结构:Conformer 与语音基础模型的内存高效压缩
声音
2025-05-28 v1 音频与语音处理
摘要
本文提出了一种针对 Conformer ASR 和语音基础系统的全新内存高效模型压缩方法。我们的方法具有独特的“从小到大”设计。一个包含少量 Conformer 或 Transformer 模块的紧凑“种子”模型被训练并多次展开,以模拟具有不同逻辑深度的较大未压缩模型的性能。种子模型和许多展开路径在单个展开周期内联合训练。最大展开模型与最小种子模型之间的 KL 散度被用于自蒸馏过程,以最小化它们的性能差距。实验结果表明,在各种深度配置下,我们的可折叠模型产生了与单独构建的 Conformer 和 wav2vec2/HuBERT 语音基础模型相当的 ASR 性能,同时仅需极少的内存和存储空间。在无性能损失的情况下,分别获得了参数量减少 35% 和 30% 的 Conformer 和 wav2vec2 模型。
引用
@article{arxiv.2505.21237,
title = {Unfolding A Few Structures for The Many: Memory-Efficient Compression of Conformer and Speech Foundation Models},
author = {Zhaoqing Li and Haoning Xu and Xurong Xie and Zengrui Jin and Tianzi Wang and Xunying Liu},
journal= {arXiv preprint arXiv:2505.21237},
year = {2025}
}
备注
Accepted by Interspeech2025