中文

利用先导推理加速语音理解

音频与语音处理 2024-10-14 v3 计算与语言 机器学习

摘要

现代语音理解(SU)运行一个复杂的流水线:摄取流式语音输入后,该流水线反复执行基于编码器-解码器的深度神经网络;通过这种方式,流水线生成暂定输出(称为假设),并周期性地对假设进行打分。本文旨在加速资源受限边缘设备上的 SU。它采用混合方法:加速设备端执行;将超出设备能力的输入卸载。虽然该方法众所周知,我们通过新技术解决 SU 的独特挑战:(1)延迟上下文化,在输入摄取的同时并行执行模型的注意力编码器;(2)先导推理,缓解 SU 流水线的时间负载不平衡;(3)自回归卸载,基于先导推理和假设评估卸载决策。我们的技术与现有语音模型、流水线和框架兼容;它们可独立或组合应用。我们的原型称为 PASU,在具有 6-8 个核心的 Arm 平台上测试:它达到了 SOTA 精度;将端到端延迟降低 2 倍,并将卸载需求降低 2 倍。

关键词

引用

@article{arxiv.2311.17065,
  title  = {Turbocharge Speech Understanding with Pilot Inference},
  author = {Rongxiang Wang and Felix Xiaozhu Lin},
  journal= {arXiv preprint arXiv:2311.17065},
  year   = {2024}
}