NLI:非均匀线性插值近似非线性运算以提高 LLM 推理效率
机器学习
2026-02-04 v1 人工智能
摘要
大型语言模型(LLM)在广泛的任务上展现出惊人的性能,但其部署常受制于巨大的内存占用和计算成本。虽然先前工作在压缩和加速线性层方面取得了显著进展,但非线性层(如 SiLU、RMSNorm 和 Softmax)仍严重依赖高精度浮点运算。在本文中,我们提出了一种无校准、以动态规划为最优、且硬件友好的框架,称为非均匀线性插值(Non-uniform Linear Interpolation, NLI)。NLI 能够有效地近似各种非线性函数,实现了在 LLM 和其他深度神经网络中的几乎无损集成。NLI 巧妙地将切点选择重新表述为动态规划问题,借助 Bellman 最优原理在 O(MxN²) 时间内实现全局最小插值误差。基于 NLI 算法,我们还设计并实现了一个即插即用的通用非线性计算单元。硬件实验表明,NLI 引擎在计算效率方面相较于最新设计实现了 4 倍以上的提升。
引用
@article{arxiv.2602.02988,
title = {NLI:Non-uniform Linear Interpolation Approximation of Nonlinear Operations for Efficient LLMs Inference},
author = {Jiangyong Yu and Xiaomeng Han and Xing Hu and Chen Xu and Zhe Jiang and Dawei Yang},
journal= {arXiv preprint arXiv:2602.02988},
year = {2026}
}
备注
Admitted to ICLR 18pages 5 figures