中文

Skipformer:一种用于高效语音识别的跳跃-恢复策略

计算与语言 2024-05-22 v2 机器学习

摘要

基于Conformer的注意力模型已成为自动语音识别任务的事实骨干模型。通常引入一个空白符号来对齐CTC或RNN-T模型的输入和输出序列。不幸的是,较长的输入长度使得注意力机制的计算预算和内存消耗呈二次方增长。在这项工作中,我们提出了一种“跳跃-恢复”Conformer架构,名为Skipformer,以动态且非均匀地压缩序列输入长度。Skipformer使用一个中间的CTC输出作为标准,将帧分为三组:关键组、跳跃组和忽略组。关键组馈入后续的conformer块,其输出与跳跃组按原始时间顺序合并,作为最终的编码器输出。实验表明,我们的模型在Aishell-1上将输入序列长度减少了31倍,在Librispeech语料库上减少了22倍。同时,该模型能够实现比近期基线模型更好的识别准确率和更快的推理速度。我们的代码已开源并可在线获取。

关键词

引用

@article{arxiv.2403.08258,
  title  = {Skipformer: A Skip-and-Recover Strategy for Efficient Speech Recognition},
  author = {Wenjing Zhu and Sining Sun and Changhao Shan and Peng Fan and Qing Yang},
  journal= {arXiv preprint arXiv:2403.08258},
  year   = {2024}
}

备注

Accepted by ICME2024