Delta Keyword Transformer: 通过动态剪枝多头自注意力将 Transformer 部署至边缘
计算与语言
2022-04-08 v1 机器学习
摘要
多头自注意力构成了 Transformer 网络的核心。然而,其相对于输入序列长度的二次方增长复杂度阻碍了其在资源受限的边缘设备上的部署。我们通过提出一种动态剪枝方法来解决这一挑战,该方法利用跨 token 数据的时间稳定性来降低推理成本。这种基于阈值的方法仅保留后续 token 之间的显著差异,有效减少了乘加运算次数以及内部张量数据大小。该方法在 Google Speech Commands Dataset 上针对关键词识别进行了评估,并将其性能与基线 Keyword Transformer 进行了比较。我们的实验表明,在保持原有 98.4% 准确率的同时,我们可以减少约 80% 的运算。此外,当仅降低 1-4% 的准确率时,可减少约 87-94% 的运算,将多头自注意力推理速度提升了约 7.5-16 倍。
关键词
引用
@article{arxiv.2204.03479,
title = {Delta Keyword Transformer: Bringing Transformers to the Edge through Dynamically Pruned Multi-Head Self-Attention},
author = {Zuzana Jelčicová and Marian Verhelst},
journal= {arXiv preprint arXiv:2204.03479},
year = {2022}
}