中文

Moonshine v2: 面向延迟关键型语音应用的遍历流式编码器 ASR

计算与语言 2026-02-13 v1 机器学习 声音

摘要

延迟关键型语音应用(例如,实时转录、语音命令和实时翻译)要求低的首令牌时间 (TTFT) 和高转录准确率,尤其是在资源受限的边缘设备上。全注意力 Transformer 编码器仍然是自动语音识别 (ASR) 的强准确率基线,因为每一帧都可以直接关注其他所有帧,从而利用远距离词汇上下文解决局部模糊的声学问题。然而,这种全局依赖关系导致序列长度呈二次复杂度,并产生固有的“编码整个话语”的延迟特性。对于流式用例,这会导致 TTFT 随话语长度线性增长,因为编码器必须处理整个前缀,然后才能发出任何解码器令牌。为了更好地满足设备端流式 ASR 用例的需求,我们引入了 Moonshine v2,一种遍历流式编码器 ASR 模型,它采用滑动窗口自注意力来实现有界、低延迟的推理,同时保留强大的局部上下文。我们的模型在标准基准测试中实现了最先进的词错误率,其准确率与规模大 6 倍的模型相当,同时运行速度显著更快。这些结果表明,精心设计的局部注意力在准确率上可与全注意力相媲美,而规模和延迟成本却大大降低,为边缘设备上的交互式语音界面开辟了新的可能性。

关键词

引用

@article{arxiv.2602.12241,
  title  = {Moonshine v2: Ergodic Streaming Encoder ASR for Latency-Critical Speech Applications},
  author = {Manjunath Kudlur and Evan King and James Wang and Pete Warden},
  journal= {arXiv preprint arXiv:2602.12241},
  year   = {2026}
}

备注

7 pages, 5 figures