TinyCL:一种用于自主系统持续学习的高效硬件架构
机器学习
2025-05-07 v4
摘要
持续学习(CL)范式通过持续演化深度神经网络(DNN)模型的参数来逐步学习执行新任务,同时不降低在先前任务上的性能,即避免所谓的灾难性遗忘。然而,在基于CL的自主系统中,DNN参数更新极其消耗资源。现有的DNN加速器无法直接用于CL,因为它们仅支持前向传播的执行。仅有少数先前架构执行反向传播和权重更新,但缺乏针对CL的控制与管理。为此,我们设计了一种硬件架构TinyCL,用于在资源受限的自主系统上执行CL。它由一个执行前向和反向传播的处理单元以及一个管理基于内存的CL工作负载的控制单元组成。为了最小化内存访问,卷积层的滑动窗口以蛇形方式移动。此外,乘加单元可在运行时重新配置以执行不同的操作。据我们所知,我们提出的TinyCL是首个在自主系统上执行CL的硬件加速器。我们在65 nm CMOS工艺节点下采用传统ASIC设计流程对完整的TinyCL架构进行了综合。它在1.76 s内完成了对CIFAR10数据集上Conv + ReLU + Dense模型的1个epoch训练,而使用Nvidia Tesla P100 GPU对同一模型进行1个epoch训练需103 s,从而实现了58倍的加速,在4.74 mm2的芯片上功耗为86 mW。
引用
@article{arxiv.2402.09780,
title = {TinyCL: An Efficient Hardware Architecture for Continual Learning on Autonomous Systems},
author = {Eugenio Ressa and Alberto Marchisio and Maurizio Martina and Guido Masera and Muhammad Shafique},
journal= {arXiv preprint arXiv:2402.09780},
year = {2025}
}
备注
Accepted at the 2025 International Joint Conference on Neural Networks (IJCNN), Rome, Italy, July 2025