QWHA:面向大语言模型的参数高效微调的量化感知 Walsh-Hadamard 适配
计算与语言
2026-05-20 v4
摘要
大语言模型(LLM)的高效部署需求推动了量化技术的兴趣,这技术降低了推理成本;以及参数高效微调(PEFT),后者降低了训练开销。这催生了量化感知 PEFT 以产生准确且高效的量化模型。在此情境下,降低量化误差以进行微调对于实现高模型精度至关重要。然而,现有方法依赖低秩适配器,受限于表示能力。最近基于傅里叶变换(FT)的适配器相较于低秩适配器具有更大的表示能力,但其直接集成到量化模型中常导致效果降低和计算开销增加。为克服这些限制,我们提出了 QWHA 方法,通过采用 Walsh-Hadamard 变换(WHT)作为变换内核,结合自适应参数选择和价值细化的新型适配器初始化方案,将 FT-based 适配器集成到量化模型中。我们展示,QWHA 有效缓解了量化误差,促进了微调,其设计显著降低了计算成本。实验结果表明,QWHA 在低位量化精度上一致优于基线方法,在已有 FT-based 适配器的训练加速方面实现了显著提升。代码已公开于 https://github.com/vantaa89/qwha。
引用
@article{arxiv.2509.17428,
title = {QWHA: Quantization-Aware Walsh-Hadamard Adaptation for Parameter-Efficient Fine-Tuning on Large Language Models},
author = {Hyesung Jeon and Seojune Lee and Beomseok Kang and Yulhwa Kim and Jae-Joon Kim},
journal= {arXiv preprint arXiv:2509.17428},
year = {2026}
}
备注
25 pages, 9 figures, 14 tables