可学习脉冲积累用于设备内语音识别:你到底需要多少注意力?
音频与语音处理
2026-03-19 v1 声音
摘要
自注意力机制随序列长度呈二次增长,限制了基于Transformer的语音模型在边缘设备上的应用。我们引入可学习脉冲积累器(Learnable Pulse Accumulator, LPA),它以O(n)复杂度替代关键查询点积,采用学习型门控函数:内容依赖的矩形脉冲、周期窗口和位置相关基函数。通过MSE诊断扫描确定各层替换的难度及顺序。将12个wav2vec2-base层中的8个替换后,在LibriSpeech test-clean上实现10.61%的词错误率(WER),比3.37%的基线高出7.24个百分点,在Apple M4 Pro上实现3.27倍加速,通过优化的MLX推理路径。在SepFormer语音增强上的跨域验证表明,所有16个内部块注意力层均可被替换而不导致崩溃,表明深度限制源于语言计算而非LPA局限。LPA在推理时近二进制门控,使GPU计算密集且无需CPU-GPU同步,所有操作均可映射到移动神经加速器。
关键词
引用
@article{arxiv.2603.16922,
title = {Learnable Pulse Accumulation for On-Device Speech Recognition: How Much Attention Do You Need?},
author = {Yakov Pyotr Shkolnikov},
journal= {arXiv preprint arXiv:2603.16922},
year = {2026}
}