中文

剪枝但不牺牲真理:为保障LLM真实性而进行权重剪枝

机器学习 2025-09-04 v2 计算与语言

摘要

网络剪枝已成为在低资源场景下部署LLM且保持下游任务性能的有前景的方法。然而,我们首次揭示,这种剪枝会破坏LLM内部激活特征,这些特征对于lie detection至关重要,其中探针分类器(通常是小型逻辑回归模型)训练于这些特征,用于评估LLM生成陈述的真实性。这一发现引发了一个关键问题:如何在不牺牲这些关键lie detection能力的情况下剪枝LLM?我们的进一步调查显示,基于重要性进行的层级剪枝稀疏度调整操作不慎地移除了关键权重,尽管依赖于最关键的LLM层,但未能提高lie detection性能。为解决此问题,我们提出了由层级异常值决定的Truthful Pruning(TPLO),该方法更强调具有更多激活异常值和更强判别特征的层。这样既保留了LLM的原始性能,又保留了用于robust lie detection所需的内部状态关键特征。此外,我们引入一种提示规则来丰富TruthfulQA基准,以更好地校准LLM剪枝。实证结果表明,我们的方法在稀疏度为50%时提高了被剪枝LLM的幻觉检测准确率(达到88%),并提升了其TruthfulQA性能。

关键词

引用

@article{arxiv.2509.00096,
  title  = {Pruning Weights but Not Truth: Safeguarding Truthfulness While Pruning LLMs},
  author = {Yao Fu and Runchao Li and Xianxuan Long and Haotian Yu and Xiaotian Han and Yu Yin and Pan Li},
  journal= {arXiv preprint arXiv:2509.00096},
  year   = {2025}
}

备注

Accepted to EMNLP2025 findings (poster)