中文

量化盲区:模型压缩如何破坏后门防御

机器学习 2025-12-09 v1 密码学与安全

摘要

后门攻击在保持高干净准确率的同时,将输入依赖的恶意行为嵌入神经网络,成为部署中机器学习系统的持续威胁。与此同时,实际部署几乎从不提供全精度模型:后训练量化至INT8或更低精度是降低内存和延迟的标准做法。本工作提出了一个简单问题:现有后门防御在标准量化管道下如何表现?我们对五种代表性防御方法进行系统实证研究,涵盖三个精度设置(FP32、INT8动态、INT4模拟)和两个标准视觉基准测试,使用标准BadNet攻击。我们观察到INT8量化将所有评估防御的检测率降至0%,但攻击成功率仍保持在99%以上。对于INT4,我们发现显著的数据依赖性:Neural Cleanse在GTSRB上仍有效,但在CIFAR-10上失败,尽管后门在量化后仍存活,攻击成功率超过90%。我们的结果揭示了防御常在FP32模型上评估与实际部署(以量化形式)之间的偏差,凸显量化鲁棒性作为未来后门防御评估与设计中的必要维度。

关键词

引用

@article{arxiv.2512.06243,
  title  = {Quantization Blindspots: How Model Compression Breaks Backdoor Defenses},
  author = {Rohan Pandey and Eric Ye},
  journal= {arXiv preprint arXiv:2512.06243},
  year   = {2025}
}

备注

10 pages