面向低功耗 RISC-V 边缘设备的轻量级机器学习训练
机器学习
2025-09-24 v1 硬件体系结构
摘要
现代物联网设备日益依赖机器学习解决方案在本地处理数据。然而,大多数平台缺乏图形处理器(GPU)或专用加速器,使得设备训练基本不可行,常需依赖云端服务。此过程常引发隐私问题,并依赖始终可用的网络连接。联邦学习(Federated Learning, FL)是一种新趋势,通过在设备上实现去中心化协作训练来解决这些问题,但需要高度有效的优化算法。L-SGD 是一种轻量级随机梯度下降变体,已在 Arm Cortex-M 微控制器单元(MCU)上实现神经网络训练。本工作将 L-SGD 扩展到基于 RISC-V 的 MCU,后者是一种开放且新兴的架构,仍缺乏稳健的设备训练支持。在 Arm 与 RISC-V 平台上使用 32 位浮点运算评估了 L-SGD,突显 RISC-V MCU 缺乏浮点单元(FPU)的性能影响。为缓解这些限制,我们引入一种 8 位量化版 L-SGD,内存使用几乎降低 4 倍,训练时间加速 2.2 倍,准确率几乎不变。
引用
@article{arxiv.2509.18118,
title = {Decentor-V: Lightweight ML Training on Low-Power RISC-V Edge Devices},
author = {Marcelo Ribeiro and Diogo Costa and Gonçalo Moreira and Sandro Pinto and Tiago Gomes},
journal= {arXiv preprint arXiv:2509.18118},
year = {2025}
}