立场:深度学习中的零阶优化未被充分探索,而非能力不足
机器学习
2026-05-19 v2
摘要
零阶(ZO)优化,即通过函数评估的有限差分进行学习而无需反向传播,因其内存效率和对灰盒或黑盒流程的适用性,最近在深度学习中重新受到关注。然而,ZO 方法常因估计量方差和不利的查询复杂度而被认为从根本上不可扩展。我们认为这一结论可能被误导了:ZO 优化是未被充分探索,而非能力不足。我们表明,许多感知到的局限性源于短视的开发实践,最显著的是全空间、逐元素、以估计量为中心的设计。我们阐述了涵盖算法、系统和评估栈的六个立场。首先,我们通过方差控制、方差-查询权衡和方向导数的视角,重新审视了以估计量为中心的 ZO 方法的可行性边界。然后,我们确定了三个未被充分探索的机会:(i)ZO 的子空间和谱视图,能够实现可解释的方差缩减和优雅的查询扩展;(ii)ZO 的纯前向特性作为系统优势,适用于通信高效、管道友好和资源受限的训练;(iii)需要将 ZO 评估从任务复杂性中解混淆。我们强烈主张围绕 ZO 优化的独特优势进行重新思考并采取相应行动,为利用 ZO 优化实现大规模、系统感知和资源高效的学习开辟一条可行路径。
引用
@article{arxiv.2605.15622,
title = {Position: Zeroth-Order Optimization in Deep Learning Is Underexplored, Not Underpowered},
author = {Sijia Liu and Yicheng Lang and Soumyadeep Pal and Changsheng Wang and Yancheng Huang and Chongyu Fan and James Diffenderfer and Bhavya Kailkhura and Yihua Zhang},
journal= {arXiv preprint arXiv:2605.15622},
year = {2026}
}
备注
Accepted by ICML 2026 Position Paper Track as a Spotlight Paper