面向注意力机制深度神经网络的高效 Softmax 近似方法
机器学习
2021-11-23 v1 人工智能
摘要
用于加速深度神经网络(DNNs)推理速度的定制硬件(HW)发展迅速。此前,softmax 层并非 DNN 加速硬件的主要关注点,因为在多层感知机或卷积神经网络中其所占比例相对较小。然而,随着注意力机制在各种现代 DNN 中被广泛使用,softmax 层的高性价比实现正变得非常重要。本文提出两种基于查找表(LUTs)使用的 softmax 计算近似方法。由于在对输入进行归一化后 softmax 分子与分母的范围稳定,LUT 所需大小非常小(约 700 字节)。我们通过在多种 AI 任务(目标检测、机器翻译、情感分析、语义等价)和 DNN 模型(DETR、Transformer、BERT)上,使用一系列基准(COCO17、WMT14、WMT17、GLUE)验证了所提技术。我们表明,8 位近似可使精度损失低于 ,达到可接受水平。
引用
@article{arxiv.2111.10770,
title = {Efficient Softmax Approximation for Deep Neural Networks with Attention Mechanism},
author = {Ihor Vasyltsov and Wooseok Chang},
journal= {arXiv preprint arXiv:2111.10770},
year = {2021}
}
备注
17 pages, 5 figures