中文

面向设备端 LLM 微调的高效结构化反向传播

机器学习 2026-02-16 v1 计算与语言

摘要

设备端微调使大语言模型实现隐私保护的个性化定制,但移动设备通常在所有工作负载中共享严格的内存限制,仅为 6--12GB。现有方法在精确梯度(高内存)与低内存的噪声估计之间进行权衡。我们提出内存高效结构化反向传播(MeSP),通过手动推导反向传播路径,利用 LoRA 的低秩结构。我们的关键洞察是,中间投影 h = xA 可在反向传播期间以最小成本重新计算,因为秩 r ≪ d_in,无需存储它。MeSP 在 Qwen2.5 模型(0.5B--3B)上实现了比 MeBP 平均 49% 的内存降低,同时计算数学上等价的梯度。我们的分析还揭示,MeZO 的梯度估计与真实梯度几乎无相关性(余弦相似度 ≈ 0.001),解释了其收敛缓慢的原因。MeSP 将 Qwen2.5-0.5B 的峰值内存从 361MB 降至 136MB,使之前在内存受限设备上不可行的微调场景成为可能。

关键词

引用

@article{arxiv.2602.13069,
  title  = {Memory-Efficient Structured Backpropagation for On-Device LLM Fine-Tuning},
  author = {Juneyoung Park and Yuri Hong and Seongwan Kim and Jaeho Lee},
  journal= {arXiv preprint arXiv:2602.13069},
  year   = {2026}
}

备注

Under the review, 11 pages