中文

语音识别中的深度学习模型:测量 GPU 能耗、噪声影响与面向边缘部署的模型量化

声音 2024-05-03 v1 人工智能 计算机视觉与模式识别 人机交互 机器学习 音频与语音处理

摘要

近期基于 Transformer 的 ASR 模型已实现了低于 4% 的词错误率(WER),超越了人类标注员的准确率,但它们需要大量的服务器资源,导致了显著的碳足迹。传统的基于服务器的 ASR 架构也带来了隐私问题,同时由于网络依赖性而存在可靠性和延迟问题。相比之下,设备端(边缘)ASR 增强了隐私性,提升了性能,并通过有效平衡特定应用的能耗与准确性促进了可持续性。本研究考察了量化、内存需求和能耗对 NVIDIA Jetson Orin Nano 上各种 ASR 模型推理性能的影响。通过分析在干净和噪声数据集上使用 FP32、FP16 和 INT8 量化的模型的 WER 和转录速度,我们强调了准确性、速度、量化、能效和内存需求之间的关键权衡。我们发现,在不同模型中,将精度从 fp32 更改为 fp16 可使音频转录的能耗减半,且性能下降极小。更大的模型尺寸和参数数量既不能保证对噪声有更好的鲁棒性,也不能预测给定转录负载的能耗。这些发现以及其他几项结果为在能耗和内存受限的环境中优化 ASR 系统提供了新见解,这对于开发高效的设备端 ASR 解决方案至关重要。本文复现结果所需的代码和输入数据已开源,可在 [https://github.com/zzadiues3338/ASR-energy-jetson] 获取。

关键词

引用

@article{arxiv.2405.01004,
  title  = {Deep Learning Models in Speech Recognition: Measuring GPU Energy Consumption, Impact of Noise and Model Quantization for Edge Deployment},
  author = {Aditya Chakravarty},
  journal= {arXiv preprint arXiv:2405.01004},
  year   = {2024}
}