中文

为多数展开少数结构:Conformer 与语音基础模型的内存高效压缩

声音 2025-05-28 v1 音频与语音处理

摘要

本文提出了一种针对 Conformer ASR 和语音基础系统的全新内存高效模型压缩方法。我们的方法具有独特的“从小到大”设计。一个包含少量 Conformer 或 Transformer 模块的紧凑“种子”模型被训练并多次展开,以模拟具有不同逻辑深度的较大未压缩模型的性能。种子模型和许多展开路径在单个展开周期内联合训练。最大展开模型与最小种子模型之间的 KL 散度被用于自蒸馏过程,以最小化它们的性能差距。实验结果表明,在各种深度配置下,我们的可折叠模型产生了与单独构建的 Conformer 和 wav2vec2/HuBERT 语音基础模型相当的 ASR 性能,同时仅需极少的内存和存储空间。在无性能损失的情况下,分别获得了参数量减少 35% 和 30% 的 Conformer 和 wav2vec2 模型。

关键词

引用

@article{arxiv.2505.21237,
  title  = {Unfolding A Few Structures for The Many: Memory-Efficient Compression of Conformer and Speech Foundation Models},
  author = {Zhaoqing Li and Haoning Xu and Xurong Xie and Zengrui Jin and Tianzi Wang and Xunying Liu},
  journal= {arXiv preprint arXiv:2505.21237},
  year   = {2025}
}

备注

Accepted by Interspeech2025