中文

BitFlipScope:面向 LLM 位翻转损坏的可扩展故障定位与恢复

分布式、并行与集群计算 2026-04-17 v2 人工智能 硬件体系结构 密码学与安全 机器学习

摘要

在实际和安全关键环境中部署的大型语言模型(LLM)日益易受由硬件退化、宇宙辐射或如 Rowhammer 等故障注入攻击引起的位翻转故障的影响。这些故障会静默地破坏内部参数,可能导致不可预测或危险的模型行为。局部化这些损坏至关重要:若不识别受影响区域,便无法诊断降级来源、应用针对性纠正措施或在不进行高成本微调或完整重新训练的情况下恢复模型功能。本 work 引入了 BitFlipScope,这是一个面向 transformer 架构的可扩展、基于软件的框架,用于在两种部署场景下识别故障影响区域。当可获得干净参考模型时,BitFlipScope 对输出、隐藏状态和内部激活进行差分分析,以检测指示损坏异常行为的特征,从而定位或局部化故障。当没有参考模型时,它使用残差路径扰动和损失灵敏度分析直接从损坏模型中推断故障影响区域。在这两种情况下,该框架不仅有效地实现了故障诊断,还支持无需微调的轻量级性能恢复,为恢复受损模型提供了实用路径。正是由于这些能力,BitFlipScope 成为面向硬件易受故障影响和对抗环境中可信赖、抗故障 LLM 部署的重要一步。

关键词

引用

@article{arxiv.2512.22174,
  title  = {BitFlipScope: Scalable Fault Localization and Recovery for Bit-Flip Corruptions in LLMs},
  author = {Muhammad Zeeshan Karamat and Sadman Saif and Christiana Chamon Garcia},
  journal= {arXiv preprint arXiv:2512.22174},
  year   = {2026}
}

备注

Accepted at the IEEE International Symposium on Hardware Oriented Security and Trust (HOST) 2026