中文

NLI:非均匀线性插值近似非线性运算以提高 LLM 推理效率

机器学习 2026-02-04 v1 人工智能

摘要

大型语言模型(LLM)在广泛的任务上展现出惊人的性能,但其部署常受制于巨大的内存占用和计算成本。虽然先前工作在压缩和加速线性层方面取得了显著进展,但非线性层(如 SiLU、RMSNorm 和 Softmax)仍严重依赖高精度浮点运算。在本文中,我们提出了一种无校准、以动态规划为最优、且硬件友好的框架,称为非均匀线性插值(Non-uniform Linear Interpolation, NLI)。NLI 能够有效地近似各种非线性函数,实现了在 LLM 和其他深度神经网络中的几乎无损集成。NLI 巧妙地将切点选择重新表述为动态规划问题,借助 Bellman 最优原理在 O(MxN²) 时间内实现全局最小插值误差。基于 NLI 算法,我们还设计并实现了一个即插即用的通用非线性计算单元。硬件实验表明,NLI 引擎在计算效率方面相较于最新设计实现了 4 倍以上的提升。

关键词

引用

@article{arxiv.2602.02988,
  title  = {NLI:Non-uniform Linear Interpolation Approximation of Nonlinear Operations for Efficient LLMs Inference},
  author = {Jiangyong Yu and Xiaomeng Han and Xing Hu and Chen Xu and Zhe Jiang and Dawei Yang},
  journal= {arXiv preprint arXiv:2602.02988},
  year   = {2026}
}

备注

Admitted to ICLR 18pages 5 figures