草图自适应:用于高效 LLM 适应的可微调草图
机器学习
2026-01-05 v3
摘要
适配预训练大型语言模型(LLM)至关重要但具有挑战性,因为其规模巨大。参数高效微调(PEFT)技术通常采用 additive adapters 作用于冻结的模型权重。为进一步减少内存使用,模型权重常通过量化进行压缩。然而,现有 PEFT 方法往往因依赖诸如限制性假设(例如对适配器进行低秩约束以限制可训练参数数量)而导致模型质量次优。我们发现, sketching 作为一种流行的数据压缩技术,可作为高效的 LLM 适应策略,避免低秩假设。我们引入 SketchTune,一种压缩适应策略,将 LLM 权重压缩到紧凑的可微调草图中,将压缩和适应整合到统一框架中。这种集成消除了现有 PEFT 技术中复杂的双路径计算,实现更快更高效的训练和推理。SketchTune 受益于对矩阵类别的数学洞见,这些矩阵类别通过 sketching 进行近似优于低秩方法。我们通过 Llama 和 Mistral 模型进行大规模评估,证明 SketchTune 在各种任务中超越领先的 PEFT 方法,同时使用规模更小的基础模型和相当数量的可训练参数。作为亮点,SketchTune 在 commonsense 和 math 基准测试中使用 2.6-3.5 更小的基础模型,超过 LoRA、DoRA 和 S2FT;在 GSM8K 上以 7.3 更少的可训练参数,准确率高出 14.48%。我们的代码已公开于 https://github.com/LeanModels/SketchTune。
引用
@article{arxiv.2410.06364,
title = {Sketch to Adapt: Fine-Tunable Sketches for Efficient LLM Adaptation},
author = {Tianyi Zhang and Junda Su and Aditya Desai and Oscar Wu and Zhaozhuo Xu and Anshumali Shrivastava},
journal= {arXiv preprint arXiv:2410.06364},
year = {2026}
}
备注
Published in ICML 2025