FusionFormer:融合Transformer中操作以实现高效流式语音识别
声音
2022-11-01 v1 计算与语言
音频与语音处理
摘要
近来提出的Conformer架构将卷积与注意力相结合以捕获局部与全局依赖,已成为自动语音识别(ASR)的事实骨干模型。继承自自然语言处理(NLP)任务,该架构默认采用层归一化(LN)作为归一化技术。然而,通过一系列系统研究,我们发现尽管LN仅占总FLOPs的0.1%,却可能占据推理时间的10%。这促使我们借助算子融合方法并避免推理时计算均值与方差统计量,以其他归一化技术(如批归一化(BN))替换LN来加速推理。在考察了几种直接移除所有LN层或在同一位置以BN替换的朴素尝试后,我们发现发散问题主要由层输出不稳定引起。因此我们提出为每个线性层或卷积层追加一个BN层,从而观察到稳定的训练结果。我们还提出通过将Swish和GLU等激活替换为ReLU来简化Conformer中的激活。所有这些被替换的模块均可融合进相邻线性/卷积层的权重中,因而具有零推理开销。因此我们将其命名为FusionFormer。我们的实验表明,FusionFormer与基于LN的Conformer同样有效,且约快10%。
引用
@article{arxiv.2210.17079,
title = {FusionFormer: Fusing Operations in Transformer for Efficient Streaming Speech Recognition},
author = {Xingchen Song and Di Wu and Binbin Zhang and Zhiyong Wu and Wenpeng Li and Dongfang Li and Pengshen Zhang and Zhendong Peng and Fuping Pan and Changbao Zhu and Zhongqin Wu},
journal= {arXiv preprint arXiv:2210.17079},
year = {2022}
}
备注
8 pages, plus 3 appendix