中文

Splitformer:面向边缘设备的自动语音识别改进式早退出架构

计算与语言 2025-06-24 v1 声音 音频与语音处理

摘要

动态调整神经模型在推理期间计算负载的能力,在资源受限且计算资源时变性的场景中至关重要。早退出架构因其能够通过处理输入子集并在中间分支处提前退出(移除最上层)而成为优雅且有效的解决方案。从另一个角度看,自动语音识别应用存在内存高效神经网络结构,通过在中间层应用可变帧率分析(通过下采样/上采样操作)来减少总运算量,显著提升在众多基准测试上的性能。例如 Zipformer。然而,这些架构缺乏必要的模块化才能注入早退出分支。为提高早退出模型的性能,我们提出在架构中引入平行层,这些层处理来自其输入的下采样版本的输入。我们展示,通过这种方式,标准基准上的语音识别性能显著提升,仅需轻微增加整体模型参数,却不影响推理时间。

关键词

引用

@article{arxiv.2506.18035,
  title  = {Splitformer: An improved early-exit architecture for automatic speech recognition on edge devices},
  author = {Maxence Lasbordes and Daniele Falavigna and Alessio Brutti},
  journal= {arXiv preprint arXiv:2506.18035},
  year   = {2025}
}

备注

5 pages, 3 Postscript figures