面向设备端处理的 E2E SLU 模型张量分解压缩
音频与语音处理
2023-06-05 v1
摘要
口语语言理解(SLU)是一项关键的语音识别应用,通常部署在边缘设备上。因此,设备端处理在 SLU 的实际应用中起着重要作用。本文关注端到端(E2E)SLU 模型,因其具有不同于级联系统的小延迟特性,旨在最小化计算成本。我们通过将张量分解应用于 E2E SLU 模型中使用的 Conformer 和 E-Branchformer 架构来缩减模型规模。我们提出分别对线性层应用奇异值分解、对卷积层应用 Tucker 分解。我们还将 COMP/PARFAC 分解和 Tensor-Train 分解与 Tucker 分解进行比较。由于 E2E 模型由单一神经网络表示,我们的张量分解可在不改变特征维度的情况下灵活控制参数量。在 STOP 数据集上,我们在仅 1500 万参数的严格约束下取得了 70.9% 的精确匹配准确率。
引用
@article{arxiv.2306.01247,
title = {Tensor decomposition for minimization of E2E SLU model toward on-device processing},
author = {Yosuke Kashiwagi and Siddhant Arora and Hayato Futami and Jessica Huynh and Shih-Lun Wu and Yifan Peng and Brian Yan and Emiru Tsunoo and Shinji Watanabe},
journal= {arXiv preprint arXiv:2306.01247},
year = {2023}
}
备注
Accepted by INTERSPEECH 2023