PEANO-ViT:Vision Transformer 中非线性函数的高效近似
计算机视觉与模式识别
2024-08-19 v2 人工智能
图像与视频处理
摘要
在硬件平台(尤其是 Field-Programmable Gate Arrays, FPGA)上部署 Vision Transformer (ViT) 面临诸多挑战,主要源于其非线性函数(尤其是层归一化、softmax 和高斯误差线性单元 (GELU))的巨大计算和能源需求。这些关键函数因其复杂的数学运算以及 FPGA 的固有资源数目和架构限制,构成了高效硬件实现的重大障碍。PEANO-ViT 提出了一种新方法,通过引入无除法技术同时近似除法和平方根函数,以精简层归一化层的实现。此外,PEANO-ViT 提供多尺度除法策略,以 Pade-based 近似指数函数辅助,消除 softmax 层中的除法运算。最后,PEANO-ViT 引入分段线性近似 GELU 函数,仔细设计以规避与 GELU 相关的计算密集型运算。在全面评估中,PEANO-ViT 对 DeiT-B 的准确率降低不超过 0.5%,同时显著提升能源效率,对层归一化、softmax 和 GELU 分别实现 1.91 倍、1.39 倍、8.01 倍的提升。通过大幅度降低这些非线性运算的 DSP、LUT 和寄存器数量,PEANO-ViT 使得 Vision Transformer 能在资源受限和能源受限的 FPGA 平台上高效部署。
引用
@article{arxiv.2406.14854,
title = {PEANO-ViT: Power-Efficient Approximations of Non-Linearities in Vision Transformers},
author = {Mohammad Erfan Sadeghi and Arash Fayyazi and Seyedarmin Azizi and Massoud Pedram},
journal= {arXiv preprint arXiv:2406.14854},
year = {2024}
}