中文

是否实现了两十年前的预言?仅通过一次位翻转即可诱发大型语言模型的人工坏智能

密码学与安全 2025-10-02 v1

摘要

最近,位翻转攻击 (BFA) 因其通过硬件故障注入远程危害软件系统完整性而广受关注。随着大型语言模型 (LLM) 被蒸馏并部署为单文件 .gguf 格式,其权重空间暴露于前所未有的硬件攻击面。本文首次系统性发现并验证了 LLM 权重文件中单比特漏洞的存在:在主流开源模型(如 DeepSeek 和 QWEN)使用 .gguf 量化格式时,仅翻转单个比特即可诱发三类面向语义层面的定向失效:人工欺骗智能(输出事实错误)、人工弱智能(逻辑推理能力下降)以及人工坏智能(生成有害内容)。通过构建信息论权重灵敏度熵模型和名为 BitSifter 的概率启发式扫描框架,我们高效定位了数亿参数模型中关键漏洞位点。实验表明,漏洞在张量数据区域显著集中,尤其是与注意力机制和输出层相关的区域最为敏感。我们观察到模型规模与鲁棒性呈负相关,小型模型更易受攻击。此外,设计了一条远程 BFA 链,实现真实环境中的语义级攻击:以每秒 464.3 次的攻击频率,单个比特在最短仅 31.7 秒内即可实现 100% 成功,使 LLM 准确率从 73.5% 降至 0%,无需高成本设备或复杂的提示工程。

关键词

引用

@article{arxiv.2510.00490,
  title  = {Has the Two-Decade-Old Prophecy Come True? Artificial Bad Intelligence Triggered by Merely a Single-Bit Flip in Large Language Models},
  author = {Yu Yan and Siqi Lu and Yang Gao and Zhaoxuan Li and Ziming Zhao and Qingjun Yuan and Yongjuan Wang},
  journal= {arXiv preprint arXiv:2510.00490},
  year   = {2025}
}

备注

19 pages