中文

LLM 零阶精调是一种推理工作负载

机器学习 2026-05-28 v1

摘要

零阶(ZO)精调因取代反向传播而具有吸引力。然而,现有实现仍在常规训练循环中执行ZO算法,尽管其主要工作是对相邻参数状态下的重复评分。这导致工作负载与运行时不匹配:算法要求结构化的推理式评分,而系统则暴露为一系列碎片化的训练循环步骤。我们表明,LLM 零阶精调是推理主导型工作负载,并通过 serving 运行时执行其重复评分阶段。在OPT-13B SST-2上, resulting vLLM 执行路径在0.51估计训练小时内完成20k步 LoZO 运行,相较于4.15小时的官方 LoZO 基线(匹配 LoRA-only 设置下)加快8.13倍,同时达到0.922最终评估准确率和0.931最终完整验证准确率。在OPT-1.3B至OPT-13B的核心步骤扩展实验中,相同的运行时重组方式给出2.34倍至7.72倍的加速。MeZO 风格的高秩分解实验显示,相同的运行时范式可在最高达2.55倍的速度下跟踪 MeZO 类损失轨迹。更广泛地说,将 ZO 更新表示为动态适配器状态,指向推理时间训练的实用路径:轻量级适应可被调度为推理式工作负载,而非独立的训练作业。

关键词

引用

@article{arxiv.2605.28760,
  title  = {LLM Zeroth-Order Fine-Tuning is an Inference Workload},
  author = {Zelin Li and Caiwen Ding},
  journal= {arXiv preprint arXiv:2605.28760},
  year   = {2026}
}

备注

12 pages, 4 figures, 3 tables, including appendix and references