中文

DAPA:面向设备端 Transformer 推理与训练的分布感知分段激活函数

机器学习 2026-03-23 v1

摘要

非线性激活函数在设备端推理与训练中发挥关键作用,因为它们不仅会消耗大量硬件资源,还对系统性能和能源效率产生显著影响。本文提出了一种称为 Distribution-Aware Piecewise Activation (DAPA) 的激活函数,用于 Transformer 架构,通过利用 pre-activation 数据的分布实现可微分且硬件友好的设计。DAPA 采用非均匀分段近似方法,将更细的分段区域分配给分布中高概率的区域,从而在先前分段线性方法的通用性方面取得改进。该近似结果进一步使用 Distribution-Weighted Mean Square Error 进行量化,以减少硬件部署的延迟和资源利用。我们的 HLS 实现表明,DAPA 将 GELU 计算加速 16 倍,并将 DSP 利用率降低 16 倍,同时在视觉 Transformer 和 GPT-2 模型上保持与原方法相当或更好的性能。

关键词

引用

@article{arxiv.2603.19338,
  title  = {DAPA: Distribution Aware Piecewise Activation Functions for On-Device Transformer Inference and Training},
  author = {Maoyang Xiang and Bo Wang},
  journal= {arXiv preprint arXiv:2603.19338},
  year   = {2026}
}