在边缘端使用局部梯度进行学习
机器学习
2022-09-19 v2 人工智能
摘要
为在边缘设备上实现快速收敛和低内存的学习,我们提出一种名为目标投影随机梯度下降(tpSGD)的新型无反向传播优化算法。tpSGD 将直接随机目标投影推广至适用于任意损失函数,并将目标投影扩展至循环神经网络(RNNs)及前馈网络的训练。tpSGD 使用分层随机梯度下降(SGD)和通过标签随机投影生成的局部目标,仅以正向传播逐层训练网络。tpSGD 在优化过程中无需保留梯度,与需要多次存储整个神经网络权重、输入/输出及中间结果的 SGD 反向传播(BP)方法相比,大幅减少了内存占用。我们的方法在由全连接层、卷积层和循环层组成的较浅网络上,精度在 BP 梯度下降的 5% 以内。tpSGD 还在由多层感知机、卷积神经网络(CNNs)和 RNNs 组成的浅层模型中,以具竞争力的精度和更少的内存与时间优于其他最先进的免梯度算法。我们在训练深度神经网络(如 VGG)中评估了 tpSGD 的性能,并将该方法扩展至多层 RNNs。这些实验凸显了利用 tpSGD 在边缘端进行针对域偏移的基于层的适配器优化训练的相关新研究方向。
关键词
引用
@article{arxiv.2208.08503,
title = {Learning with Local Gradients at the Edge},
author = {Michael Lomnitz and Zachary Daniels and David Zhang and Michael Piacentino},
journal= {arXiv preprint arXiv:2208.08503},
year = {2022}
}