面向模拟存储器梯度训练的精确训练
机器学习
2024-06-19 v1 硬件体系结构
最优化与控制
摘要
鉴于使用大型视觉或语言模型的高昂经济和环境成本,模拟存储器加速器为实现能效AI提供了有前景的解决方案。虽然最近研究了模拟加速器上的推理,但训练视角仍较不受关注。最近的研究表明,数字AI训练的“核心”——随机梯度下降(SGD)算法在应用于非理想设备进行模型训练时会收敛不准确。本文为模拟设备上的梯度训练提供了理论基础。我们首先对SGD的非收敛问题进行表征,这由模拟设备上的非对称更新所致。随后,我们给出渐近误差的下界,表明SGD基于模拟训练存在根本性的性能限制,而非分析工具的副产品。为解决此问题,我们研究一种近期表现优于SGD的启发式模拟算法,称为Tiki-Taka,并严格证明其能够精确收敛至临界点,从而消除渐近误差。仿真结果验证了分析的正确性。
引用
@article{arxiv.2406.12774,
title = {Towards Exact Gradient-based Training on Analog In-memory Computing},
author = {Zhaoxian Wu and Tayfun Gokmen and Malte J. Rasch and Tianyi Chen},
journal= {arXiv preprint arXiv:2406.12774},
year = {2024}
}
备注
10 pages, 5 figures,2 tables