黑箱层神经网络训练的低秩代理建模与随机零阶优化
机器学习
2026-05-05 v2
摘要
能源效率高性能 AI 系统日益增长的需求,导致人们关注替代计算平台(如光子、类神经)由于其加速学习与推理的潜力而受到关注。然而,将此类物理组件集成到深度学习管道中仍具有挑战性,因为物理设备往往表达力有限,且其非可微性质使得基于设备的反向传播难以实现或不可行。这促使开发混合架构,将数字神经网络与可重构物理层相结合,这些层实际上表现为黑箱。在本工作中,我们提出了一个用于训练此类混合网络的框架。该框架集成了用于更新物理层内部参数的随机零阶优化,并采用动态低秩代理模型实现对物理层的梯度传播。我们方法的关键组件是隐式投影分裂积分器算法,该算法在每次前向传播后更新轻量级代理模型,最小化硬件查询次数,从而避免了昂贵的完整矩阵重构。我们在 diverse 深度学习任务中展示了该方法的效果,包括:计算机视觉、音频分类和语言建模。在所有模态方面,所提出的方法实现了接近数字基线的准确率,并始终有效地实现了包含各种非可微物理组件(空间光调制器、微环共振器和马赫-齐耳干涉仪)的混合模型的端到端训练。这一工作桥接了硬件感知深度学习和梯度-free 优化,为将不可微物理组件集成到可扩展、端到端可训练 AI 系统提供了实用路径。
引用
@article{arxiv.2509.15113,
title = {Low-rank surrogate modeling and stochastic zero-order optimization for training of neural networks with black-box layers},
author = {Andrei Chertkov and Artem Basharin and Mikhail Saygin and Evgeny Frolov and Stanislav Straupe and Ivan Oseledets},
journal= {arXiv preprint arXiv:2509.15113},
year = {2026}
}