中文

基于关键帧机制的高效 Conformer 端到端语音识别

声音 2023-10-31 v2 计算与语言 音频与语音处理

摘要

近来,Conformer 作为端到端自动语音识别的骨干网络取得了最先进的性能。Conformer 块利用自注意力机制捕获全局信息,并利用卷积神经网络捕获局部信息,从而提升了性能。然而,基于 Conformer 的模型在自注意力机制上遇到问题,因为计算复杂度随输入序列长度呈二次增长。受先前解码过程中 Connectionist Temporal Classification (CTC) 引导的空白跳过的启发,我们将中间 CTC 输出作为引导引入 Conformer 编码器的下采样过程。我们将具有非空白输出的帧定义为关键帧。具体而言,我们引入基于关键帧的自注意力 (KFSA) 机制,一种利用关键帧降低自注意力机制计算量的新方法。我们提出的方法结构包含两个编码器。在初始编码器之后,我们引入中间 CTC 损失函数来计算标签帧,使我们能够提取关键帧与空白帧用于 KFSA。此外,我们引入基于关键帧的下采样 (KFDS) 机制,直接作用于高维声学特征并丢弃对应空白标签的帧,从而得到作为第二编码器输入的新声学特征序列。使用所提方法取得了与原始 Conformer 及 Efficient Conformer 等其他类似工作相当或更高的性能。同时,我们提出的方法在模型训练与推理过程中可丢弃超过 60% 的无用帧,这将显著加速推理速度。本工作代码见 {https://github.com/scufan1990/Key-Frame-Mechanism-For-Efficient-Conformer}

关键词

引用

@article{arxiv.2310.14954,
  title  = {Key Frame Mechanism For Efficient Conformer Based End-to-end Speech Recognition},
  author = {Peng Fan and Changhao Shan and Sining Sun and Qing Yang and Jianwei Zhang},
  journal= {arXiv preprint arXiv:2310.14954},
  year   = {2023}
}

备注

This manuscript has been accepted by IEEE Signal Processing Letters for publication