中文

基于量化潜回放的端侧持续学习TinyML平台

机器学习 2022-09-07 v1 人工智能

摘要

近年来,针对超低功耗设备的深度学习模型与技术(即TinyML)的研发主要聚焦于“先训练后部署”的假设,模型静态化,若无非基于云的数据收集与微调便无法适应新采集的数据。基于潜回放(Latent Replay)的持续学习(CL)技术[1]原则上支持在线、无服务器的适配,但迄今其计算与内存开销对通常基于微控制器的超低功耗TinyML设备而言仍过大。本工作中,我们介绍一个基于10核支持FP32的并行超低功耗(PULP)处理器的端到端CL软硬件平台。我们重新设计了基线潜回放CL算法,利用模型冻结阶段的量化与潜回放(LR)来降低内存成本,且对精度影响极小。具体而言,与全精度基线实现相比,LR内存的8位压缩几乎无损(3000LR时-0.26%),但所需内存减少4倍;7位压缩亦可选用,仅带来额外极小精度下降(最高5%)。我们还为PULP处理器引入了前向与反向传播的优化原语。结果表明,结合这些技术,持续学习可实际用于少于64MB内存——这一量级可嵌入TinyML设备。在我们名为VEGA的先进22nm平台原型上,所提方案平均比低功耗STM32 L4微控制器快65倍,能效高37倍,足以在每分钟学习一个新mini-batch数据时维持535小时寿命。

关键词

引用

@article{arxiv.2110.10486,
  title  = {A TinyML Platform for On-Device Continual Learning with Quantized Latent Replays},
  author = {Leonardo Ravaglia and Manuele Rusci and Davide Nadalini and Alessandro Capotondi and Francesco Conti and Luca Benini},
  journal= {arXiv preprint arXiv:2110.10486},
  year   = {2022}
}

备注

14 pages