中文

Sink 或 SWIM:大规模实时语音识别

声音 2026-04-14 v1 软件工程 音频与语音处理

摘要

实时自动语音识别系统日益集成到语音助手、直播转写等交互式应用中。然而,在保持低延迟和高准确率的前提下,将这些系统扩展到支持多个并发客户端仍是重大挑战。本文提出 SWIM,一种基于 OpenAI Whisper 模型构建的新型实时 ASR 系统,实现真正的模型级并行化,以支持可扩展的多语言转录。SWIM 可在不修改底层模型的前提下支持多个并发音频流,引入一种缓冲区合并策略,在保持转录保真度的同时确保高效资源使用。我们在多客户端环境下对 SWIM 进行评估——扩展至 20 个并发用户——并展示其在英文、意大利语和西班牙语等多语言场景中,能够在保持低延迟和高吞吐量的同时提供准确的实时转录。虽然 Whisper-Streaming 在单客户端、英文专属场景下,约为 8.2% 的词错误率(WER),平均延迟约为 3.4 秒,但 SWIM 将此能力扩展到多语言、多客户端环境。它在约 5 个并发客户端时保持相当准确性,延迟降至约 2.4 秒,并且能够有效扩展至 20 个并发客户端,同时不降低转录质量和整体吞吐量。我们的方法在动态、多用户环境中提升了鲁棒性和效率,推动了可扩展 ASR 的发展。

关键词

引用

@article{arxiv.2601.17097,
  title  = {Sink or SWIM: Tackling Real-Time ASR at Scale},
  author = {Federico Bruzzone and Walter Cazzola and Matteo Brancaleoni and Dario Pellegrino},
  journal= {arXiv preprint arXiv:2601.17097},
  year   = {2026}
}

备注

14 pages, 7 figures