OpenAI Whisper 模型的量化:比较分析
声音
2025-03-14 v1 计算与语言
机器学习
音频与语音处理
摘要
自动语音识别(ASR)模型在字幕、语音翻译和实时转录等应用中获得了广泛关注。本文研究了 Whisper 及其两个模型变体:一个针对实时语音流优化,另一个针对离线转录。值得注意的是,这些模型被发现会生成幻觉内容,降低了转录可靠性。此外,较大的模型变体表现出更高的延迟,并在资源受限设备上的部署面临挑战。本研究分析了三种 Whisper 模型之间的异同,定性地考察了它们各自的能力。接下来,本研究量化了模型量化对延迟的影响,并评估了其在边缘部署中的可行性。使用开源 LibriSpeech 数据集,本文通过三种量化方法(INT4、INT5、INT8)评估了 whispercpp 的词错误率(WER)及延迟分析。结果表明,量化将延迟降低了 19%,模型大小减少了 45%,同时保持了转录准确性。这些发现为不同 Whisper 模型的最优使用场景和边缘设备部署可能性提供了见解。所有代码、数据集和实现细节均可在公开 GitHub 仓库中获取:https://github.com/allisonandreyev/WhisperQuantization.git
引用
@article{arxiv.2503.09905,
title = {Quantization for OpenAI's Whisper Models: A Comparative Analysis},
author = {Allison Andreyev},
journal= {arXiv preprint arXiv:2503.09905},
year = {2025}
}
备注
7 pages