利用先导推理加速语音理解
音频与语音处理
2024-10-14 v3 计算与语言
机器学习
摘要
现代语音理解(SU)运行一个复杂的流水线:摄取流式语音输入后,该流水线反复执行基于编码器-解码器的深度神经网络;通过这种方式,流水线生成暂定输出(称为假设),并周期性地对假设进行打分。本文旨在加速资源受限边缘设备上的 SU。它采用混合方法:加速设备端执行;将超出设备能力的输入卸载。虽然该方法众所周知,我们通过新技术解决 SU 的独特挑战:(1)延迟上下文化,在输入摄取的同时并行执行模型的注意力编码器;(2)先导推理,缓解 SU 流水线的时间负载不平衡;(3)自回归卸载,基于先导推理和假设评估卸载决策。我们的技术与现有语音模型、流水线和框架兼容;它们可独立或组合应用。我们的原型称为 PASU,在具有 6-8 个核心的 Arm 平台上测试:它达到了 SOTA 精度;将端到端延迟降低 2 倍,并将卸载需求降低 2 倍。
引用
@article{arxiv.2311.17065,
title = {Turbocharge Speech Understanding with Pilot Inference},
author = {Rongxiang Wang and Felix Xiaozhu Lin},
journal= {arXiv preprint arXiv:2311.17065},
year = {2024}
}