中文

Q-resafe:量化大语言模型的安全风险评估与量化感知安全补丁

机器学习 2025-06-26 v1 人工智能

摘要

量化大语言模型(LLMs)因能在资源受限环境中部署而日益受到关注和重视。然而,近期关于少数无需校准数据集的量化方法的研究表明,量化可能会损害LLMs的安全能力,这凸显了进行系统性安全评估和制定有效缓解策略的迫切需求。本文利用广泛接受的安全基准,对各种主流量化技术和不同校准数据集进行了全面的安全评估。针对已识别的安全漏洞,我们提出了一种量化感知的安全补丁框架Q-resafe,以有效恢复量化LLMs的安全能力,同时最小化对实用性的不利影响。大量实验结果表明,即使在具有挑战性的评估场景下,Q-resafe也能成功地将量化LLMs的安全性与量化前的模型重新对齐。项目页面位于:https://github.com/Thecommonirin/Qresafe。

关键词

引用

@article{arxiv.2506.20251,
  title  = {Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models},
  author = {Kejia Chen and Jiawen Zhang and Jiacong Hu and Yu Wang and Jian Lou and Zunlei Feng and Mingli Song},
  journal= {arXiv preprint arXiv:2506.20251},
  year   = {2025}
}

备注

ICML 2025