中文

基于全能神经网络的一遍式多重conformer与基础语音系统压缩与量化

声音 2024-06-17 v1 人工智能 音频与语音处理

摘要

我们提出一种新颖的单-pass方式多个ASR系统联合压缩和量化方法,使用全能神经模型。单个压缩循环允许同时构建多个具有不同编码器深度、宽度和量化精度设置的嵌套系统,无需单独训练和存储每个目标系统。实验一致地表明,单个全能模型压缩的多个ASR系统,其词错误率(WER)相当于或低于等于各个单独训练的等复杂度系统,最多可降低1.01个绝对值(6.98个相对值)。实现了3.4倍的整体系统压缩和训练时间加速。最大模型大小压缩比率分别为Switchboard-300hr Conformer和LibriSpeech-100hr微调的wav2vec2.0基线模型达到12.8倍和3.93倍,未引入统计上显著的WER增加。

关键词

引用

@article{arxiv.2406.10160,
  title  = {One-pass Multiple Conformer and Foundation Speech Systems Compression and Quantization Using An All-in-one Neural Model},
  author = {Zhaoqing Li and Haoning Xu and Tianzi Wang and Shoukang Hu and Zengrui Jin and Shujie Hu and Jiajun Deng and Mingyu Cui and Mengzhe Geng and Xunying Liu},
  journal= {arXiv preprint arXiv:2406.10160},
  year   = {2024}
}

备注

Accepted by Interspeech 2024