面向频繁模型更新的逐轴权重增量
机器学习
2025-12-24 v1
摘要
服务众多任务专用 LLM 变体常受限于精细调优检查点的大尺寸以及随之而来的冷启动延迟。由于精细调优后的权重与基础模型之间的差异仅为相对较小的结构化残差,因此一种自然的做法是将其表示为压缩后的增量。我们提出一种简单高效的 1 位增量方案,仅存储权重差异的符号及来自小型校准集学习得的轻量级逐轴(行/列)FP16 缩放因子。该设计保持了 1 位增量的紧凑性,同时更准确地捕捉权重维度间的变化,相较于标量方案在重构质量上取得改进。从系统层面看,一个简化的加载器可在每个模块上进行一次打包增量的传输,减少冷启动延迟和存储开销,所需存储空间仅为完整 FP16 检查点的数倍。该方法即插即用,需的校准数据极少,同时通过避免稠密重构保持推理效率。我们的实验设置和源代码已公开于 https://github.com/kuiumdjiev/Per-Axis-Weight-Deltas-for-Frequent-Model-Updates。
引用
@article{arxiv.2512.19720,
title = {Per-Axis Weight Deltas for Frequent Model Updates},
author = {Stefan Kuyumdzhiev and Radostin Cholakov},
journal= {arXiv preprint arXiv:2512.19720},
year = {2025}
}
备注
10 pages, 2 figures, AI That Keeps Up: Workshop on Continual and Compatible Foundation Model Updates (CCFM), Neurips 2025