中文

SOLE:面向高效Transformer推理的Softmax与LayerNorm硬件-软件协同设计

机器学习 2025-10-21 v1 硬件体系结构

摘要

Transformer在自然语言处理(NLP)和计算机视觉(CV)任务中表现卓越,但其实际推理速度和效率受限于Softmax和层归一化(LayerNorm)的效率低下。基于函数近似的先前方法忽视了内存开销,仅关注计算,此外依赖重新训练来补偿近似误差,成本高昂且不便。本文提出SOLE,即一种面向Softmax和LayerNorm的硬件-软件协同设计,包含E2Softmax和AILayerNorm。E2Softmax利用以log2为基数的指数函数量化和基于log的除法来近似Softmax,而AILayerNorm采用低精度统计计算。与最先进的设计相比,SOLE实现了对Softmax和LayerNorm的低精度计算和低位宽存储。实验表明,SOLE在不重新训练的情况下维持推理准确性,同时相对于GPU实现了数量级的加速和能源节省,分别为Softmax和LayerNorm实现了3.04倍、3.86倍的能效提升和2.82倍、3.32倍的面积效益。

关键词

引用

@article{arxiv.2510.17189,
  title  = {SOLE: Hardware-Software Co-design of Softmax and LayerNorm for Efficient Transformer Inference},
  author = {Wenxun Wang and Shuchang Zhou and Wenyu Sun and Peiqin Sun and Yongpan Liu},
  journal= {arXiv preprint arXiv:2510.17189},
  year   = {2025}
}