AutoQNN:一种用于自动量化神经网络的端到端框架
机器学习
2023-04-11 v1 人工智能
计算机视觉与模式识别
摘要
探索具有合适混合精度策略的预期量化方案是以高效率和高精度压缩深度神经网络(DNNs)的关键点。这种探索给领域专家带来了繁重的工作负载,因此需要一种自动压缩方法。然而,自动方法的巨大搜索空间引入了大量的计算预算,使得该自动过程难以应用于实际场景。在本文中,我们提出了一个名为 AutoQNN 的端到端框架,用于在无需任何人工的情况下自动利用不同方案和位宽量化不同层。AutoQNN 通过涉及三种技术:量化方案搜索(QSS)、量化精度学习(QPL)和量化架构生成(QAG),为主流 DNN 模型高效寻找理想的量化方案和混合精度策略。QSS 引入五种量化方案并定义三种新方案作为方案搜索的候选集,然后使用可微神经架构搜索(DNAS)算法从该集合中寻找层或模型所需的方案。据我们所知,QPL 是第一种通过重新参数化量化方案的位宽来学习混合精度策略的方法。QPL 高效优化 DNN 的分类损失和精度损失,并在有限的模型大小和内存占用内获得相对最优的混合精度模型。QAG 旨在将任意架构转换为相应的量化架构而无需人工干预,以促进端到端神经网络量化。我们已实现 AutoQNN 并将其集成到 Keras 中。大量实验表明,AutoQNN 能持续优于最先进的量化方法。
引用
@article{arxiv.2304.03782,
title = {AutoQNN: An End-to-End Framework for Automatically Quantizing Neural Networks},
author = {Cheng Gong and Ye Lu and Surong Dai and Deng Qian and Chenkun Du and Tao Li},
journal= {arXiv preprint arXiv:2304.03782},
year = {2023}
}
备注
22 pages, 9 figures, 7 tables, Journal of Computer Science and Technology