中文

面向注意力机制深度神经网络的高效 Softmax 近似方法

机器学习 2021-11-23 v1 人工智能

摘要

用于加速深度神经网络(DNNs)推理速度的定制硬件(HW)发展迅速。此前,softmax 层并非 DNN 加速硬件的主要关注点,因为在多层感知机或卷积神经网络中其所占比例相对较小。然而,随着注意力机制在各种现代 DNN 中被广泛使用,softmax 层的高性价比实现正变得非常重要。本文提出两种基于查找表(LUTs)使用的 softmax 计算近似方法。由于在对输入进行归一化后 softmax 分子与分母的范围稳定,LUT 所需大小非常小(约 700 字节)。我们通过在多种 AI 任务(目标检测、机器翻译、情感分析、语义等价)和 DNN 模型(DETR、Transformer、BERT)上,使用一系列基准(COCO17、WMT14、WMT17、GLUE)验证了所提技术。我们表明,8 位近似可使精度损失低于 1.0%1.0\%,达到可接受水平。

关键词

引用

@article{arxiv.2111.10770,
  title  = {Efficient Softmax Approximation for Deep Neural Networks with Attention Mechanism},
  author = {Ihor Vasyltsov and Wooseok Chang},
  journal= {arXiv preprint arXiv:2111.10770},
  year   = {2021}
}

备注

17 pages, 5 figures