中文

无需数据或优化:通过符号位翻转破坏神经网络的极限脑损伤

机器学习 2026-04-17 v2 人工智能 计算机视觉与模式识别

摘要

深度神经网络(DNN)可以通过翻转少量参数位就会被毁灭。我们引入Deep Neural Lesion(DNL),一种无数据、无优化的方法,用于定位关键参数,并提出一种增强的单遍变体1P-DNL,通过对随机输入执行一次前向和反向传播来细化此选择。我们展示了这种漏洞跨越多个领域,包括图像分类、目标检测、实例分割以及大型语言模型推理。在图像分类中,仅翻转 ResNet-50 在 ImageNet 上的两个符号位即可将准确性降低至 99.8%。在目标检测和实例分割中,一个或两个符号位翻转会使基于 Mask R-CNN 和 YOLOv8-seg 模型的 COCO 检测和掩码平均精度(AP)崩溃。在语言建模中,两个符号位翻转到不同的专家会将 Qwen3-30B-A3B-Thinking 的准确性从 78% 降至 0%。我们还表明,通过保护少数易受攻击的符号位的少数比例,可提供针对此类攻击的实用防御措施。

关键词

引用

@article{arxiv.2502.07408,
  title  = {Maximal Brain Damage Without Data or Optimization: Disrupting Neural Networks via Sign-Bit Flips},
  author = {Ido Galil and Moshe Kimhi and Ran El-Yaniv},
  journal= {arXiv preprint arXiv:2502.07408},
  year   = {2026}
}

备注

10 pages, 5 figures. Accepted as a Featured Paper at Transactions on Machine Learning Research (TMLR)