针对LLM量化攻击的对抗性对比学习
密码学与安全
2026-01-07 v1 机器学习
摘要
模型量化是将大语言模型 (LLM) 部署到资源受限硬件上的关键技术,但近期研究揭示了在量化后良性 LLM 可能表现出恶意行为的严重安全风险。本文提出对抗性对比学习 (ACL),一种新型基于梯度的量化攻击,通过显式最大化良性响应概率与恶意响应概率之间的差距,实现卓越的攻击效果。ACL 将攻击目标形式化为基于三元组的对比损失,并将其集成到投射梯度下降双阶段分布式微调策略中,以确保稳定且高效的优化。大量实验表明,ACL 在 over-refusal、jumpstart 和广告注入攻击方面的攻击成功率分别达到86.00%、97.69% 和92.40%,显著优于最新方法分别高出44.67%、18.84% 和50.80%。
引用
@article{arxiv.2601.02680,
title = {Adversarial Contrastive Learning for LLM Quantization Attacks},
author = {Dinghong Song and Zhiwei Xu and Hai Wan and Xibin Zhao and Pengfei Su and Dong Li},
journal= {arXiv preprint arXiv:2601.02680},
year = {2026}
}
备注
14 pages, 5 figures