LLM 零阶精调是一种推理工作负载
机器学习
2026-05-28 v1
摘要
零阶(ZO)精调因取代反向传播而具有吸引力。然而,现有实现仍在常规训练循环中执行ZO算法,尽管其主要工作是对相邻参数状态下的重复评分。这导致工作负载与运行时不匹配:算法要求结构化的推理式评分,而系统则暴露为一系列碎片化的训练循环步骤。我们表明,LLM 零阶精调是推理主导型工作负载,并通过 serving 运行时执行其重复评分阶段。在OPT-13B SST-2上, resulting vLLM 执行路径在0.51估计训练小时内完成20k步 LoZO 运行,相较于4.15小时的官方 LoZO 基线(匹配 LoRA-only 设置下)加快8.13倍,同时达到0.922最终评估准确率和0.931最终完整验证准确率。在OPT-1.3B至OPT-13B的核心步骤扩展实验中,相同的运行时重组方式给出2.34倍至7.72倍的加速。MeZO 风格的高秩分解实验显示,相同的运行时范式可在最高达2.55倍的速度下跟踪 MeZO 类损失轨迹。更广泛地说,将 ZO 更新表示为动态适配器状态,指向推理时间训练的实用路径:轻量级适应可被调度为推理式工作负载,而非独立的训练作业。
引用
@article{arxiv.2605.28760,
title = {LLM Zeroth-Order Fine-Tuning is an Inference Workload},
author = {Zelin Li and Caiwen Ding},
journal= {arXiv preprint arXiv:2605.28760},
year = {2026}
}
备注
12 pages, 4 figures, 3 tables, including appendix and references