LLaMA3 量化的实证研究:从大语言模型到多模态大语言模型
机器学习
2025-01-14 v3
摘要
LLaMA 系列是一系列参数从 7B 到 65B 的基础语言模型,已成为最强大的开源大语言模型(LLM)之一,也是多模态大语言模型(MLLM)的流行 LLM 底层,广泛用于计算机视觉和自然语言理解任务中。特别是,LLaMA3 模型最近发布,凭借在超过 15T 数据上的超大规模预训练,在各个领域取得了令人瞩目的成绩。鉴于低位量化在资源受限场景中对 LLM 的广泛应用,我们探索了 LLaMA3 在低位宽量化下的能力。这种探索可能为 LLaMA3 及其他未来 LLM 的低位量化提供新见解和挑战,尤其是针对 LLM 压缩中出现的性能下降问题。具体而言,我们全面评估了 LLaMA3 1-8 位下 10 种现有的后训练量化和 LoRA 微调(LoRA-FT)方法,以揭示 LLaMA3 的低位量化性能。为了探索低位量化 MLLM 的能力,我们评估了基于 LLaMA3 的 LLaVA-Next-8B 模型在 2-4 位超低位下的后训练量化方法性能。我们的实验结果表明,LLaMA3 在语言和视觉语境中仍会出现显著的性能下降,尤其是在超低位宽时。这一发现凸显了在低位宽上存在显著的性能差距,这需要在未来开发中加以解决。我们期望本实证研究在推动未来模型发展方面具有价值,推动 LLM 和 MLLM 在更低位宽下实现更高精度,从而提升实用性。我们的项目已发布于 https://github.com/Macaronlin/LLaMA3-Quantization,量化模型已发布于 https://huggingface.co/Efficient-ML。
引用
@article{arxiv.2404.14047,
title = {An empirical study of LLaMA3 quantization: from LLMs to MLLMs},
author = {Wei Huang and Xingyu Zheng and Xudong Ma and Haotong Qin and Chengtao Lv and Hong Chen and Jie Luo and Xiaojuan Qi and Xianglong Liu and Michele Magno},
journal= {arXiv preprint arXiv:2404.14047},
year = {2025}
}