中文

Sim-T:基于复用技术简化Transformer网络用于语音识别

声音 2023-04-12 v1 计算与语言 音频与语音处理

摘要

近年来,因其优异的模型性能,Transformer网络在语音识别任务中备受关注。然而,Transformer网络常伴随沉重计算与大量参数,在算力或存储受限设备上引发严重部署问题。本文提出一种称为Sim-T的轻量模型以拓展Transformer模型的通用性。在新开发的复用技术辅助下,Sim-T可高效压缩模型且性能牺牲可忽略。具体而言,该技术包含模块权重复用与注意力分数复用两部分。此外,提出一种新颖解码器结构以促成注意力分数复用。大量实验验证了Sim-T的有效性。在Aishell-1数据集上,当所提Sim-T参数量比基线Transformer少48%时,可获得0.4% CER提升。或者,若Sim-T给出与基线Transformer相同性能,可实现69%参数量削减。在HKUST与WSJ eval92数据集上,当Sim-T参数比基线Transformer少40%时,CER与WER分别改善0.3%与0.2%。

关键词

引用

@article{arxiv.2304.04991,
  title  = {Sim-T: Simplify the Transformer Network by Multiplexing Technique for Speech Recognition},
  author = {Guangyong Wei and Zhikui Duan and Shiren Li and Guangguang Yang and Xinmei Yu and Junhua Li},
  journal= {arXiv preprint arXiv:2304.04991},
  year   = {2023}
}