中文

WhisperKit:基于十亿规模转换器的设备端实时语音识别

声音 2025-07-16 v1 计算与语言 音频与语音处理

摘要

实时自动语音识别(ASR)是许多商业应用的基本构建模块,包括实时字幕、语音输入、会议转录和医疗记录。准确度和延迟是公司部署系统时最重要的因素。我们提出WhisperKit,这是一个针对实时ASR的优化设备端推理系统,显著优于领先的云端系统。我们对比评估了服务器端系统,这些系统部署了多样化的模型,包括前沿模型(OpenAI gpt-4o-transcribe)、专有模型(Deepgram nova-3)和开源模型(Fireworks large-v3-turbo)。我们的结果显示,WhisperKit在0.46s的延迟上实现了最低延迟,同时以2.2%的词错误率(WER)实现最高准确度。本文详细描述了WhisperKit系统背后的优化措施。

关键词

引用

@article{arxiv.2507.10860,
  title  = {WhisperKit: On-device Real-time ASR with Billion-Scale Transformers},
  author = {Atila Orhon and Arda Okan and Berkin Durmus and Zach Nagengast and Eduardo Pacheco},
  journal= {arXiv preprint arXiv:2507.10860},
  year   = {2025}
}

备注

ICML 2025 - On-Device Learning for Foundational Models Workshop