中文

DeepZero: 扩展零阶优化用于深度模型训练

机器学习 2024-03-18 v4

摘要

零阶(ZO)优化已成为在难以或无法获得一阶(FO)信息时使用的一种流行的机器学习(ML)问题求解技术。然而,ZO 优化的可扩展性仍是一个开放问题:它的使用主要局限于相对小规模的 ML 问题,例如逐样本的对抗攻击生成。据我们所知,此前尚无工作在不显著降低性能的情况下证明 ZO 优化在深度神经网络(DNNs)训练中的有效性。为克服这一障碍,我们开发了 DeepZero,一个基于原则的 ZO 深度学习(DL)框架,通过三项主要创新将 ZO 优化扩展到从头训练 DNN。首先,我们展示了坐标wise 梯度估计(CGE)相比随机向量wise 梯度估计在训练精度和计算效率上的优势。其次,我们提出了一种稀疏性诱导的 ZO 训练协议,仅利用有限差分扩展模型剪枝方法,以在 CGE 中探索并利用稀疏 DL 先验。第三,我们开发了特征复用和前向并行化方法以推进 ZO 训练的实际实现。我们大量的实验表明,DeepZero 在 CIFAR-10 上训练的 ResNet-20 上达到了最先进(SOTA)精度,首次接近 FO 训练性能。此外,我们展示了 DeepZero 在认证对抗防御和基于 DL 的偏微分方程误差校正应用中的实用价值,较 SOTA 实现了 10-20% 的提升。我们相信我们的结果将启发未来关于可扩展 ZO 优化的研究,并推动黑盒 DL 的发展。代码见 https://github.com/OPTML-Group/DeepZero。

关键词

引用

@article{arxiv.2310.02025,
  title  = {DeepZero: Scaling up Zeroth-Order Optimization for Deep Model Training},
  author = {Aochuan Chen and Yimeng Zhang and Jinghan Jia and James Diffenderfer and Jiancheng Liu and Konstantinos Parasyris and Yihua Zhang and Zheng Zhang and Bhavya Kailkhura and Sijia Liu},
  journal= {arXiv preprint arXiv:2310.02025},
  year   = {2024}
}

备注

Accepted to ICLR'24. Codes are available at https://github.com/OPTML-Group/DeepZero