中文

大型语言模型后训练量化中的块间相互作用

机器学习 2024-11-07 v1 人工智能 计算与语言

摘要

后训练量化广泛用于降低神经网络的计算需求。通常,对单个子结构(如层或多层)进行量化,其目标是通过微调相应权重来最小化其预激活值的量化误差。从最小化任务损失的全局目标推导出此一局部目标涉及两个关键简化:1) 假设子结构彼此独立;2) 忽略后续子结构及任务损失的知识。在本文中,我们评估了这些简化对大型语言模型权重量化的影响。我们引入两种多块微调策略,并与单一 transformer 块微调的基线进行比较。第一种方法通过联合优化多个量化块来捕获块间权重的相关性;第二种方法则通过最小化下游预激活值的误差来整合后续块的知识,而非仅关注被量化块。我们的发现表明,这些方法的有效性取决于具体的网络模型,对某些模型无影响,但对其他模型则显著提升性能。

关键词

引用

@article{arxiv.2411.03934,
  title  = {Interactions Across Blocks in Post-Training Quantization of Large Language Models},
  author = {Khasmamad Shabanovi and Lukas Wiest and Vladimir Golkov and Daniel Cremers and Thomas Pfeil},
  journal= {arXiv preprint arXiv:2411.03934},
  year   = {2024}
}