中文

权重剪枝放大偏差:面向边缘AI的压缩大语言模型多方法研究

机器学习 2026-05-12 v1 人工智能 计算机与社会

摘要

权重剪枝被广泛提倡用于在资源受限的物联网和边缘设备上部署大语言模型,但其对模型公平性的影响仍知之甚少。我们对三个指令微调模型(Gemma-2-9b-it、Mistral-7B-Instruct-v0.3、Phi-3.5-mini-instruct)在三种剪枝方法(随机剪枝、幅度剪枝、Wanda)和四个稀疏度水平(10-70%)下,在12,148个BBQ偏差基准测试项上使用5个随机种子进行了受控实证研究,总计2,368,860条推理记录。我们的结果揭示了一个智能剪枝悖论:激活感知剪枝(Wanda)几乎完美地保持了困惑度(Mistral-7B在50%稀疏度下仅增加3.5%),却产生了最高的偏差放大,在70%稀疏度下,刻板印象依赖分数增加了83.7%,并且47-59%先前无偏的项目发展出新的刻板行为。随机剪枝完全破坏了语言能力(困惑度超过10410^4并达到10810^8),但仅产生随机水平的偏差。我们进一步表明,非结构化剪枝在真实边缘硬件上不提供任何存储节省和推理延迟降低,这削弱了其在物联网部署中使用的主要动机。在180次稠密与剪枝模型的比较中,141次(78.3%)是显著的(p<0.05p < 0.05),平均h=0.305|h| = 0.305。已发表的量化研究报告显示,多达21%的响应在有偏和无偏状态之间翻转;我们的剪枝结果显示转换率高出近三倍(47-59%),表明剪枝对对齐构成的风险在类别上大于量化。这些发现表明,基于困惑度的评估提供了行为等价性的虚假保证,物联网部署流程在边缘部署剪枝模型之前需要偏差感知验证。

关键词

引用

@article{arxiv.2605.08137,
  title  = {Weight Pruning Amplifies Bias: A Multi-Method Study of Compressed LLMs for Edge AI},
  author = {Plawan Kumar Rath and Rahul Maliakkal},
  journal= {arXiv preprint arXiv:2605.08137},
  year   = {2026}
}

备注

8 pages, 7 figures, 8 tables. Accepted at the 7th Annual World AIIoT Congress (AIIoT 2026). This is the author's accepted version; the version of record will appear in IEEE Xplore