EfficientASR:通过注意力冗余和分块前馈网络优化的语音识别网络压缩
声音
2024-05-01 v1 音频与语音处理
摘要
近年来,Transformer网络在语音识别任务中表现出色。然而,由于对计算和存储资源的高需求,其部署面临挑战。为解决此问题,本文提出一种轻量级模型EfficientASR,旨在提升Transformer模型的通用性。EfficientASR采用两个主要模块:共享残差多头注意力(SRMHA)和分块前馈网络(CFFN)。SRMHA模块有效减少网络中的冗余计算,而CFFN模块捕获空间知识并减少参数数量。在两个公开数据集Aishell-1和HKUST上验证了EfficientASR模型的有效性。实验结果表明,与基线Transformer网络相比,参数减少了36%,同时在Aishell-1和HKUST数据集上字符错误率(CER)分别改善了0.3%和0.2%。
引用
@article{arxiv.2404.19214,
title = {EfficientASR: Speech Recognition Network Compression via Attention Redundancy and Chunk-Level FFN Optimization},
author = {Jianzong Wang and Ziqi Liang and Xulong Zhang and Ning Cheng and Jing Xiao},
journal= {arXiv preprint arXiv:2404.19214},
year = {2024}
}
备注
Accepted by the 2024 International Joint Conference on Neural Networks (IJCNN 2024)