中文

深度神经网络运行时后门缓解:利用潜在空间方向

机器学习 2026-02-12 v1 人工智能 密码学与安全 计算机视觉与模式识别

摘要

机器学习模型日益出现在我们的日常生活中,因此成为寻求操纵我们所交互系统的对手攻击者的目标。一个著名的漏洞是通过中毒训练数据或恶意训练进程引入后门。后门可用于通过在输入中包含特定触发器来诱导不希望的行为。现有的缓解措施过滤训练数据、修改模型或对样本执行昂贵的输入修改。如果一个脆弱模型已经部署了,这些策略要么无效,要么效率低下。为此,我们提出一种称为 FIRE(Feature-space Inference-time REpair)的推理时后门缓解方法。我们假设触发器会导致模型内部表示中有结构且可重复的变化。我们将触发器视为各层之间潜在空间的方向,可对其进行逆向应用以纠正推理机制。因此,我们通过操纵潜在表示并将受毒化样本的特征沿后门方向移动来将后门模型反向利用。我们的评估显示,FIRE 计算开销低,优于当前各种攻击、数据集和网络架构上的运行时缓解措施。

关键词

引用

@article{arxiv.2602.10780,
  title  = {Kill it with FIRE: On Leveraging Latent Space Directions for Runtime Backdoor Mitigation in Deep Neural Networks},
  author = {Enrico Ahlers and Daniel Passon and Yannic Noller and Lars Grunske},
  journal= {arXiv preprint arXiv:2602.10780},
  year   = {2026}
}