中文

LLM的英文K_量化不会不成比例地削弱多语言性能

计算与语言 2026-01-23 v4 人工智能

摘要

对于本地部署LLM的消费者使用而言,GGUF格式和k_quantization是保持原始模型性能同时将其缩减至消费级硬件可部署大小的宝贵工具。每个权重的比特数根据其在模型推理过程中的重要性进行减少。这种重要性是通过应用'重要性矩阵'——一份相对较小的文本文件,旨在代表LLM的标准用例——来确定的。在绝大多数在线量化版本中,该文档主要以英文撰写。因此,一个悬而未决的问题是:英文语言任务的性能是否以牺牲多语言性能为代价而得以保持,以及是否可以通过替代的重要性矩阵来保持。本文通过使用三种语言(英文、挪威语和马拉雅拉姆语)撰写的的重要性矩阵对Llama3.3 70B进行量化,并在MixEval数据集上对英文和挪威语进行评估,检验了这些假设。所有相关实验均产生了不显著的结果,表明当前的量化实践不会不成比例地损害多语言性能。

关键词

引用

@article{arxiv.2503.03592,
  title  = {English K_Quantization of LLMs Does Not Disproportionately Diminish Multilingual Performance},
  author = {Karl Audun Borgersen and Morten Goodwin},
  journal= {arXiv preprint arXiv:2503.03592},
  year   = {2026}
}

备注

8 pages, 6 figures, v2