推动设备端流式语音识别极限:面向低延迟推理的紧凑高精度英语模型
人工智能
2026-04-21 v2
摘要
在无GPU加速、完全基于CPU的环境下部署高质量自动语音识别(ASR)模型,需要同时优化准确率、延迟和内存占用。我们对主流ASR架构进行系统实证研究,涵盖encoder-decoder、transducer和LLM等三大范式,在batch、chunked和streaming推理模式下进行评估。通过对50多种配置(包括OpenAI Whisper、NVIDIA Nemotron、Parakeet TDT、Canary、Conformer Transducer和Qwen3-ASR)的全面基准测试,我们发现NVIDIA的Nemotron Speech Streaming是资源受限硬件上实现实时英语流式ASR的最佳候选方案。随后,我们在ONNX Runtime中重新实现完整的流式推理管道,并对多种后训练量化策略进行控制化评估,包括importance-weighted k-quant、混合精度方案和round-to-nearest量化,结合图级算子融合。这些优化将模型从2.47 GB压缩至最低0.67 GB,同时保持WER在PyTorch基准版本的1%绝对误差内。我们推荐的配置——int4 k-quant变体,在八个标准基准测试中实现8.20%的平均流式WER,CPU上运行时延迟仅为0.56秒,快于实时,为设备端流式ASR树立了新的质量-效率Pareto点。
引用
@article{arxiv.2604.14493,
title = {Pushing the Limits of On-Device Streaming ASR: A Compact, High-Accuracy English Model for Low-Latency Inference},
author = {Nenad Banfic and David Fan and Kunal Vaishnavi and Sam Kemp and Sunghoon Choi and Rui Ren and Sayan Shaw and Meng Tang},
journal= {arXiv preprint arXiv:2604.14493},
year = {2026}
}