极限边缘计算设备上基于 Conformer 的语音识别
机器学习
2024-05-15 v3 性能
摘要
随着当今设备计算能力和资源日益强大,传统上计算密集型的自动语音识别 (ASR) 正在从云端向设备端转移,以更好地保护用户隐私。然而,在资源受限的设备(如智能手机、智能可穿戴设备和其他智能家居自动化设备)上实现设备端 ASR 仍然具有挑战性。在本文中,我们提出了一系列模型架构适配、神经网络图变换和数值优化方法,以将先进的基于 Conformer 的端到端流式 ASR 系统部署在资源受限的设备上,且不降低准确率。我们在智能可穿戴设备上实现了比实时快 5.26 倍以上(0.19 RTF)的语音识别,同时最大限度地降低了能耗并达到了 SOTA 准确率。所提出的方法广泛适用于其他基于 Transformer 的无服务器 AI 应用。此外,我们提供了关于最优预归一化器的完整理论,该理论在任何浮点精度下使用任何 Lp 范数都能在数值上稳定层归一化。
引用
@article{arxiv.2312.10359,
title = {Conformer-Based Speech Recognition On Extreme Edge-Computing Devices},
author = {Mingbin Xu and Alex Jin and Sicheng Wang and Mu Su and Tim Ng and Henry Mason and Shiyi Han and Zhihong Lei and Yaqiao Deng and Zhen Huang and Mahesh Krishnamoorthy},
journal= {arXiv preprint arXiv:2312.10359},
year = {2024}
}