中文

消费级 GPU 上 LoRA/QLoRA 微调效率分析:以 RTX 4060 为例

机器学习 2025-09-17 v1 人工智能 性能

摘要

利用 LoRA 和 QLoRA 等参数高效技术对大型语言模型(LLM)进行微调,使得在普通硬件上适配基础模型成为可能。然而,此类训练在消费级 GPU 上的效率,尤其是在严格的 8 GB VRAM 限制下,仍有待深入探索。我们提出了一项在单块 NVIDIA RTX 4060 上使用 Qwen2.5-1.5B-Instruct 模型进行 LoRA/QLoRA 微调的受控性能分析研究。在三种代表性配置中,我们系统地改变了批次大小、序列长度、优化器选择(AdamW 与 PagedAdamW)以及精度(fp16 与 bf16)。我们报告了吞吐量(tokens/s)、每 1 万 tokens 耗时以及 VRAM 占用情况,并给出了基于 GPU 板功耗限制的能耗估计。结果表明,分页优化器可将吞吐量提升高达 25%(628 tok/s 对比 500 tok/s 基线),而 bf16 的效率相比 fp16 有所下降。尽管存在 8 GB 的限制,使用参数高效策略仍可实现高达 2048 tokens 的序列长度。据我们所知,这是首个针对消费级 GPU 上 LLM 微调效率的系统性案例研究,为资源受限的研究人员和从业者提供了可复现的基准测试和实用指南。

关键词

引用

@article{arxiv.2509.12229,
  title  = {Profiling LoRA/QLoRA Fine-Tuning Efficiency on Consumer GPUs: An RTX 4060 Case Study},
  author = {MSR Avinash},
  journal= {arXiv preprint arXiv:2509.12229},
  year   = {2025}
}

备注

8 pages, 3 figures, 2 tables. Primary category: cs.LG (Machine Learning); secondary: cs.AI (Artificial Intelligence). LaTeX source with figures included