中文

Zipformer:一种更快速且更优的自动语音识别编码器

音频与语音处理 2024-04-11 v4 机器学习 声音

摘要

Conformer 已成为自动语音识别(ASR)中最流行的编码器模型。它在 transformer 中加入卷积模块以学习局部和全局依赖关系。在本工作中,我们描述了一种更快速、更省内存且性能更优的 transformer,称为 Zipformer。建模上的改变包括:1)类 U-Net 的编码器结构,其中间栈以较低帧率运行;2)重组的块结构包含更多模块,在模块内部我们重用注意力权重以提升效率;3)一种称为 BiasNorm 的改进版 LayerNorm,使我们能够保留部分长度信息;4)新的激活函数 SwooshR 和 SwooshL 比 Swish 表现更好。我们还提出了一种称为 ScaledAdam 的新优化器,它按每个张量的当前尺度缩放更新量以保持相对变化大致相同,并显式学习参数尺度。它比 Adam 收敛更快且性能更好。在 LibriSpeech、Aishell-1 和 WenetSpeech 数据集上的大量实验证明了我们提出的 Zipformer 相对于其他最先进 ASR 模型的有效性。我们的代码公开于 https://github.com/k2-fsa/icefall。

关键词

引用

@article{arxiv.2310.11230,
  title  = {Zipformer: A faster and better encoder for automatic speech recognition},
  author = {Zengwei Yao and Liyong Guo and Xiaoyu Yang and Wei Kang and Fangjun Kuang and Yifan Yang and Zengrui Jin and Long Lin and Daniel Povey},
  journal= {arXiv preprint arXiv:2310.11230},
  year   = {2024}
}

备注

Published as a conference paper at ICLR 2024