中文

深度神经网络自动异构量化用于粒子探测器边缘端低延迟推理

仪器与探测器 2021-06-22 v3 机器学习 图像与视频处理 信号处理 高能物理 - 实验

摘要

尽管对更精确解的追寻正推动深度学习研究走向更大更复杂的算法,边缘设备需要高效推理,从而减少模型尺寸、延迟与能耗。限制模型尺寸的一种技术是量化,即使用更少比特表示权重与偏置。这种方法通常导致性能下降。在此,我们引入一种方法,用于设计深度神经网络模型的最优异构量化版本,以实现最小能耗、高准确度、纳秒级推理,并全自动部署于芯片上。通过逐层、逐参数类型的自动量化流程,从广泛量化器中采样,模型能耗与尺寸被最小化,同时保持高准确度。这对于 CERN 大型强子对撞机质子-质子碰撞中的事件选择过程至关重要,其中资源严格受限且要求 O(1) μ{\mathcal O}(1)~\mus 的延迟。在现场可编程门阵列硬件上实现时,实现了纳秒级推理,且资源消耗降低了 50 倍。

关键词

引用

@article{arxiv.2006.10159,
  title  = {Automatic heterogeneous quantization of deep neural networks for low-latency inference on the edge for particle detectors},
  author = {Claudionor N. Coelho and Aki Kuusela and Shan Li and Hao Zhuang and Thea Aarrestad and Vladimir Loncar and Jennifer Ngadiuba and Maurizio Pierini and Adrian Alan Pol and Sioni Summers},
  journal= {arXiv preprint arXiv:2006.10159},
  year   = {2021}
}