PoTAcc:面向幂OfTwo量化DNN的端到端加速流水线
硬件体系结构
2026-05-08 v1 机器学习
性能
摘要
幂OfTwo(PoT)量化显著减少深度神经网络(DNN)的大小,并将乘法替换为位移运算用于推理。已有研究表明,PoT量化的DNN可为诸如图像分类等任务保留准确性;然而,其在资源受限边缘设备上的性能仍不够被充分理解。虽然通用边缘CPU和GPU未提供针对位移运算的优化后端,但定制硬件加速器能更好地利用PoT量化,通过实现专用的移位处理单元(shift-PE)来更好地利用PoT量化。然而,在现有推理框架支持有限的情况下,将PoT量化模型部署到此类加速器上仍具有挑战性。此外,不同PoT量化策略对硬件设计、性能和能源效率的影响在完整推理过程中尚未系统地探索。为此,我们提出PoTAcc,这是一个用于加速和评估资源受限边缘设备上PoT量化DNN的开源端到端流水线。PoTAcc通过TensorFlow Lite(TFLite)实现对PoT量化模型的无缝准备和部署,支持包括CPU-only系统和混合CPU-FPGA系统于内的异构平台。我们为三种PoT量化方法设计了基于移位的处理单元(shift-PE)加速器,并在两个FPGA平台上实现。我们在包括CNN和基于Transformer的架构在内的多种模型上评估了准确性、性能、能源效率和资源利用率。结果表明,我们的CPU加速器在PYNQ-Z2和Kria板上相对于CPU-only执行,为PoT量化DNN实现了最高3.6倍加速和78%的能源降低。该代码将在https://github.com/gicLAB/PoTAcc公开。
引用
@article{arxiv.2605.06082,
title = {PoTAcc: A Pipeline for End-to-End Acceleration of Power-of-Two Quantized DNNs},
author = {Rappy Saha and Jude Haris and Nicolas Bohm Agostini and David Kaeli and José Cano},
journal= {arXiv preprint arXiv:2605.06082},
year = {2026}
}
备注
Accepted to IEEE Transactions on Circuits and Systems for Artificial Intelligence (TCASAI), 2026