WhisperPipe:一种用于实时自动语音识别的资源高效流式架构
计算与语言
2026-04-29 v1 声音
摘要
实时自动语音识别(ASR)系统在转录准确率和计算效率之间面临根本性的权衡,特别是在部署像 Whisper 这样的大规模 Transformer 模型时。现有的流式方法要么通过激进的分块牺牲准确率,要么通过无界的上下文累积产生过高的内存成本。我们提出了 WhisperPipe,一种新颖的流式架构,它通过三项关键创新实现了有限的内存消耗并保持了转录质量:结合 Silero VAD 与基于能量过滤的混合语音活动检测(VAD)管道,将错误激活减少了 34%;具有重叠上下文窗口的动态缓冲机制,防止在段边界处丢失信息;以及基于语音特征平衡延迟和准确率的自适应处理策略。在 2.5 小时的多样化音频数据上进行评估,WhisperPipe 展示了 89ms 的中位端到端延迟(第 90 百分位:142ms),同时与基线 Whisper 实现相比,峰值 GPU 内存消耗降低了 48%,平均 GPU 利用率降低了 80.9%。该系统在长时间会话中保持稳定的内存使用,在 150 分钟的连续运行中增长率为零。与相关工作的比较分析表明,WhisperPipe 实现了具有竞争力的准确率(WER 在离线 Whisper 的 2% 以内),同时延迟比现有流式解决方案低 3-5 倍。该架构的模块化设计使其能够部署在从边缘设备到云基础设施的各种资源受限环境中。我们的结果表明,精心设计的架构可以在生产 ASR 系统中调和实时响应性和模型复杂性的竞争需求。
引用
@article{arxiv.2604.25611,
title = {WhisperPipe: A Resource-Efficient Streaming Architecture for Real-Time Automatic Speech Recognition},
author = {Erfan Ramezani and Mohammad Mahdi Giahi and Mohammad Erfan Zarabadipour and Amir Reza Yosefian and Hamid Ghadiri},
journal= {arXiv preprint arXiv:2604.25611},
year = {2026}
}
备注
36 pages, 14 figures. Open-source implementation available at PyPI