平衡保真度与可塑性:将混合精度微调与语言层次对齐
机器学习
2026-01-06 v4 人工智能
摘要
在资源受限的边缘设备上部署和微调大型语言模型(LLM)需要在内存占用与任务性能之间严格权衡。虽然量化感知微调已成为一种可行的解决方案,但现有范式通常将量化与适配器优化解耦。这种分离忽略了一个我们识别为保真度-可塑性权衡的基本理论约束:层适应新任务的能力(可塑性)本质上受到其冻结权重信息容量(保真度)的限制。过度量化语义关键层会形成信息瓶颈,无论适配器秩多大都无法恢复,而对鲁棒的语法层使用高精度则浪费宝贵的内存。为解决这一问题,我们提出 QR-Adaptor,一个联合优化逐层量化位宽和 LoRA 秩的统一框架。通过将资源分配建模为与模型语言层次对齐的多目标搜索,我们的方法系统地从冗余密集的层中释放内存,重新分配给容量关键的层。大量实验表明,QR-Adaptor 建立了新的帕累托前沿: notably,在严格的 4 位内存预算下微调的模型达到了与 16 位基线相当的性能,表明精确的资源对齐与模型规模同等重要。
引用
@article{arxiv.2505.03802,
title = {Balancing Fidelity and Plasticity: Aligning Mixed-Precision Fine-Tuning with Linguistic Hierarchies},
author = {Changhai Zhou and Shiyang Zhang and Yuhua Zhou and Qian Qiao and Jun Gao and Shichao Weng and Weizhong Zhang and Cheng Jin},
journal= {arXiv preprint arXiv:2505.03802},
year = {2026}
}
备注
18 pages, 5 figures