中文

基于自适应层级抽样的零阶优化普遍提升

机器学习 2026-04-21 v1

摘要

零阶优化以仅依赖前向传递的方式,为大型语言模型微调提供了一种内存高效的范式,但其实际应用受限于慢速的 wall-clock 收敛速度和高估计方差。本文剖析了 ZO 算法的运行特征,识别出生成扰动项和参数更新占训练延迟超过 40% 的关键系统瓶颈。我们认为标准的均匀探索策略根本存在结构性不匹配,因其未考虑深层网络中各层的异构灵敏度,导致计算上浪费的盲目搜索。为解决这一结构性不匹配,我们提出 AdaLeZO—an 自适应层级 ZO 优化框架。通过将层选择过程建模为非平稳多臂老虎机问题,AdaLeZO 动态地将有限的扰动预算分配给最敏感的参数。我们进一步引入基于有替换抽样的逆概率加权机制,保证无偏梯度估计,同时有效地充当时间去噪器以降低方差。在覆盖 6.7B 至 30B 参数的 LLaMA 和 OPT 模型上的大量实验表明,AdaLeZO 相较于最先进的方法实现了 1.7 倍至 3.0 倍的 wall-clock 加速。关键的是,AdaLeZO 作为通用的即插即用模块,无需额外内存开销即可无缝提升现有 ZO 优化器的效率。

关键词

引用

@article{arxiv.2604.18264,
  title  = {Universally Empowering Zeroth-Order Optimization via Adaptive Layer-wise Sampling},
  author = {Fei Wang and Li Shen and Liang Ding and Chao Xue and Ye Liu and Changxing Ding},
  journal= {arXiv preprint arXiv:2604.18264},
  year   = {2026}
}