Edge-ASR:迈向自动语音识别模型的低位量化
声音
2025-08-05 v2 机器学习
音频与语音处理
摘要
自动语音识别(ASR)的最新进展在实时转录和语音命令处理等多种音频应用中展现出了卓越的准确性和鲁棒性。然而,由于对内存、算力和功耗的严格限制,将这些模型部署在资源受限的边缘设备(例如物联网设备、可穿戴设备)上仍然面临巨大挑战。量化,特别是训练后量化(PTQ),提供了一种无需重新训练即可降低模型大小和推理成本的有效途径。尽管其重要性不言而喻,但各种先进量化方法和位宽配置对 ASR 模型性能的影响仍不明确。在这项工作中,我们对应用于两个领先的边缘 ASR 模型系列 Whisper 和 Moonshine 的八种最先进的(SOTA)PTQ 方法进行了全面基准测试。我们系统地评估了来自开放 ASR 排行榜的七个不同数据集上的模型性能(即准确率、内存 I/O 和位运算),分析了量化以及各种配置对权重和激活值的影响。基于 LLM 压缩工具包的扩展,我们的框架集成了边缘 ASR 模型、多种先进的量化算法、统一的校准和评估数据流水线以及详细的分析工具。我们的结果表征了效率与准确率之间的权衡,表明在使用先进的 PTQ 技术时,即使是 位量化也能在高容量模型上取得成功。这些发现为在低功耗、始终在线的边缘设备上优化 ASR 模型提供了有价值的见解。
引用
@article{arxiv.2507.07877,
title = {Edge-ASR: Towards Low-Bit Quantization of Automatic Speech Recognition Models},
author = {Chen Feng and Yicheng Lin and Shaojie Zhuo and Chenzheng Su and Ramchalam Kinattinkara Ramakrishnan and Zhaocong Yuan and Xiaopeng Zhang},
journal= {arXiv preprint arXiv:2507.07877},
year = {2025}
}