中文

MAFAT:面向加速边缘推理的神经网络内存感知融合与分块

机器学习 2023-07-20 v2 硬件体系结构

摘要

一个日益突出的研究挑战是在资源受限的边缘设备上本地运行高开销的机器学习(ML)网络。具有大型卷积层的 ML 网络很容易超出可用内存,因操作系统过度交换而增加延迟。先前的记忆体缩减技术如剪枝和量化会降低模型精度,且常需重新训练。另一种分布式方法将卷积划分为等价的较小子计算,但实现会引入通信开销并需要设备网络。然而,分布式划分方法也可通过在单设备上将网络细分为较小操作来以缩减的内存占用运行。在本文中,我们将先前的分布式划分工作扩展为单设备上的内存感知执行。我们的方法扩展了先前的融合策略,以允许多组卷积层被独立融合与分块。这使得能够权衡开销与数据复用,从而专门减小内存占用。我们提出了一种内存使用预测器与搜索算法相结合的方法,为任意一组卷积层提供优化的融合与分块配置。当应用于 YOLOv2 目标检测网络时,结果表明我们的方法可在不到一半的内存中运行,并在严苛内存约束下实现高达 2.78 的加速。此外,我们的算法返回的配置其延迟在手动搜索测得的最佳延迟的 6% 以内。

关键词

引用

@article{arxiv.2107.06960,
  title  = {MAFAT: Memory-Aware Fusing and Tiling of Neural Networks for Accelerated Edge Inference},
  author = {Jackson Farley and Andreas Gerstlauer},
  journal= {arXiv preprint arXiv:2107.06960},
  year   = {2023}
}