中文

SifterNet:一种通用且模型无关的触发器净化方法

机器学习 2025-05-21 v1

摘要

旨在抵御卷积神经网络和基于视觉 Transformer 的大模型中的后门攻击,本文借助经典的 Ising 模型提出了一种通用且模型无关的触发器净化方法。迄今为止,现有的触发器检测/移除研究通常需要预先了解目标模型的详细知识、访问大量干净样本甚至模型重训练授权,这给实际应用带来了巨大不便,尤其是在无法访问目标模型的情况下。理想的对策应当能够消除植入的触发器,而不论目标模型是什么。为此,通过利用 Hopfield 网络的记忆-联想功能,提出了一种轻量级的黑盒防御方法 SifterNet,借此可以以适当的方式有效净化输入样本的触发器。我们提出方法的主要新颖之处在于引入了 Ising 模型的思想。大量实验也验证了我们的方法在适当净化触发器和实现高准确度方面的有效性,并且与几个常用数据集上的最先进基线相比,我们的 SifterNet 具有显著的优越性能。

关键词

引用

@article{arxiv.2505.14531,
  title  = {SifterNet: A Generalized and Model-Agnostic Trigger Purification Approach},
  author = {Shaoye Luo and Xinxin Fan and Quanliang Jing and Chi Lin and Mengfan Li and Yunfeng Lu and Yongjun Xu},
  journal= {arXiv preprint arXiv:2505.14531},
  year   = {2025}
}