面向基于 Transducer 的语音识别的加速器感知训练
机器学习
2023-05-16 v1
摘要
机器学习模型的权重和激活值在训练期间以全精度表示。这导致在神经网络加速器(NNA)芯片上部署时运行时性能下降,因为 NNA 利用高度并行的定点运算来改善运行时内存和延迟。在这项工作中,我们在训练阶段复现 NNA 算子,在反向传播中考虑由于 NNA 上低精度推理引起的退化。我们提出的方法高效地模拟 NNA 操作,从而无需将易产生量化误差的数据传输到中央处理单元(CPU),最终降低了用户感知延迟(UPL)。我们将我们的方法应用于循环神经网络-Transducer(RNN-T),这是一种适用于设备端流式语音识别任务的有吸引力的架构。我们在 270K 小时的英语数据上训练和评估模型,并显示出引擎延迟改善 5-7%,同时节省高达 10% 的相对词错误率(WER)退化。
引用
@article{arxiv.2305.07778,
title = {Accelerator-Aware Training for Transducer-Based Speech Recognition},
author = {Suhaila M. Shakiah and Rupak Vignesh Swaminathan and Hieu Duy Nguyen and Raviteja Chinta and Tariq Afzal and Nathan Susanj and Athanasios Mouchtaris and Grant P. Strimel and Ariya Rastrow},
journal= {arXiv preprint arXiv:2305.07778},
year = {2023}
}
备注
Accepted to SLT 2022