中文

量化对 LLM 代码模型隐私风险的影响

软件工程 2025-08-04 v1

摘要

大型代码语言模型(LLMs4Code)高度依赖海量训练数据,其中包含敏感数据,如云服务凭证和开发人员的个人可识别信息,引发严重隐私担忧。成员推断(MI)最近作为评估隐私风险的有效工具,能够识别特定数据是否属于模型的训练集。与此同时,模型压缩技术,特别是量化技术,因降低计算成本而在部署大型模型方面受到青睐。然而,虽然量化后的模型仍保留来自原始训练数据的知识,但其是否影响保留和暴露隐私信息的能力尚不明确。回答这一问题对于理解实际部署中的隐私风险至关重要。本工作对量化如何同时影响 LLMs4Code 的任务性能和隐私风险进行了首次实证研究。为此,我们对三类代表性模型族(Pythia、CodeGen、GPTNeo)实施了广泛使用的量化技术(静态和动态)。我们的结果表明,量化显著降低了相对于原始模型的隐私风险。我们也发现任务性能与隐私风险呈正相关,表明存在潜在的权衡。此外,我们揭示了对更大模型进行量化可能比使用全精度小模型更能实现更好的平衡。最后,我们展示这些发现在不同架构、模型规模和 MI 方法之间具有普适性,为在部署压缩 LLMs4Code 时保护隐私提供了实用指导。

关键词

引用

@article{arxiv.2508.00128,
  title  = {How Quantization Impacts Privacy Risk on LLMs for Code?},
  author = {Md Nazmul Haque and Hua Yang and Zhou Yang and Bowen Xu},
  journal= {arXiv preprint arXiv:2508.00128},
  year   = {2025}
}