AutoMixQ:高性能内存高效微调的自适应量化
机器学习
2024-11-22 v1 人工智能
摘要
在资源受限条件下对大型语言模型 (LLM) 进行微调是深度学习中的一个重大挑战。低秩适应 (LoRA)、剪枝和量化都是提高资源效率的有效方法。然而,direct 组合它们通常会导致次优性能,尤其是对所有模型层使用统一量化。这是由于剪枝引入的复杂且不均匀的 interlayer 关系,使得更精细的量化策略成为必要。为此,我们提出 AutoMixQ,一个面向每个 LLM 层选择最佳量化配置的端到端优化框架。AutoMixQ 利用轻量级性能模型指导选择过程,显著减少了相较于彻底搜索方法的时间和计算资源。通过 incorporating Pareto 最优性,AutoMixQ 在平衡内存使用和性能之间,接近模型能力在严格资源约束下的上限。我们在广泛使用的基准测试上进行实验,表明 AutoMixQ 在减少内存消耗的同时实现了卓越的性能。例如,在 LLaMA-7B 上进行 30% 剪枝率的实验中,AutoMixQ 在 BoolQ 上的得分为 66.21%,分别较 LoRA 和 LoftQ 的 62.45% 和 58.96% 高出,内存消耗较 LoRA 减少 35.5%,较 LoftQ 减少 27.5%。
引用
@article{arxiv.2411.13814,
title = {AutoMixQ: Self-Adjusting Quantization for High Performance Memory-Efficient Fine-Tuning},
author = {Changhai Zhou and Shiyang Zhang and Yuhua Zhou and Zekai Liu and Shichao Weng},
journal= {arXiv preprint arXiv:2411.13814},
year = {2024}
}