中文

基于敏感度引导搜索的神经网络混合精度训练后量化

机器学习 2023-02-08 v2

摘要

由于模型规模和复杂度的不断增加,高效且低延迟地服务大规模机器学习(ML)模型变得具有挑战性。量化模型可同时减少内存和计算需求,促进其广泛可用。然而,对于大型模型,并非所有层都同样适用于相同的数值精度,激进的量化可能导致不可接受的模型精度损失。防止这种精度下降的一种方法是混合精度量化,它允许不同张量被量化为不同水平的数值精度,利用现代硬件的能力。此类混合精度量化可更有效地“按需”将数值精度分配给不同张量,以在减小占用和计算延迟的同时保持模型精度。在本文中,我们提出一种利用训练后混合精度量化高效确定ML模型中不同张量量化配置的方法。我们分析了三种敏感度度量,并评估它们对引导两种算法配置搜索的作用。我们在计算机视觉和自然语言处理上评估我们的方法,并展示相比基线16位浮点模型实现了高达27.59%和34.31%的延迟降低,同时保证精度下降不超过1%。

关键词

引用

@article{arxiv.2302.01382,
  title  = {Mixed Precision Post Training Quantization of Neural Networks with Sensitivity Guided Search},
  author = {Clemens JS Schaefer and Elfie Guo and Caitlin Stanton and Xiaofan Zhang and Tom Jablin and Navid Lambert-Shirzad and Jian Li and Chiachen Chou and Siddharth Joshi and Yu Emma Wang},
  journal= {arXiv preprint arXiv:2302.01382},
  year   = {2023}
}