中文

ESPnet-ONNX:弥合研究与生产之间的鸿沟

音频与语音处理 2022-11-15 v2

摘要

在深度学习领域,研究人员通常专注于发明新颖的神经网络模型和改进基准。相比之下,应用开发者感兴趣的是使模型适用于实际产品,这包括优化模型以实现更快的推理,以及使模型适配各种平台(如 C++ 和 Python)。在这项工作中,为填补二者之间的鸿沟,我们建立了一套有效的流程,用于将基于 PyTorch 的面向研究的模型优化以用于部署,并以广泛使用的语音处理工具包 ESPnet 为例。我们将多种技术引入 ESPnet,包括将模型转换为 ONNX 格式、融合图中的节点以及量化参数,这些技术在各种任务(即 ASR、TTS、语音翻译和口语理解)中带来了约 1.3-2×\times 的加速,同时保持其性能而无需任何额外训练。我们的 ESPnet-ONNX 将在 https://github.com/espnet/espnet_onnx 公开可用。

关键词

引用

@article{arxiv.2209.09756,
  title  = {ESPnet-ONNX: Bridging a Gap Between Research and Production},
  author = {Masao Someki and Yosuke Higuchi and Tomoki Hayashi and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2209.09756},
  year   = {2022}
}

备注

Accepted to APSIPA ASC 2022