中文

零阶优化学习动力学:一种核视角

机器学习 2026-05-06 v1

摘要

经典优化理论表明,零阶 (ZO) 算法因维数依赖性减慢,收敛率通常随模型维数而增大,与一阶方法相比。这与近期工作相矛盾,后者表明 ZO 方法成功应用于具有数十亿参数的大型语言模型 (LLM) 的微调。为解释这一悖论,我们推导 ZO SGD 的一步学习动力学,其中经验神经网络切向核 (eNTK) 自然作为支配学习行为的关键项。检查 ZO SGD 生成的 eNTK 可知,其每个元素对应于神经切向向量在随机低维子空间上的投影的内积。因此,依据 Johnson-Lindenstrauss 引理,我们的分析表明,ZO eNTK 的保真度主要由扰动数目决定。关键的是,近似误差取决于模型输出大小而非巨大的参数维度。这一维度自由特性为 ZO 方法在 LLM 微调任务中的可扩展性提供了理论依据。我们认为,这种基于核的框架为理解 ZO 方法在学习动力学背景下的工作提供了新视角。

关键词

引用

@article{arxiv.2605.03373,
  title  = {Learning Dynamics of Zeroth-Order Optimization: A Kernel Perspective},
  author = {Zhe Li and Bicheng Ying and Zidong Liu and Haibo Yang},
  journal= {arXiv preprint arXiv:2605.03373},
  year   = {2026}
}

备注

Accepted by ICML 2026