中文

重访背door净化中的辅助数据

密码学与安全 2025-02-12 v1

摘要

背door 攻击发生在攻击者在训练阶段 subtly 操纵机器学习模型时,导致在特定触发器存在时出现意外行为。为缓解此类新兴威胁,常见策略是通过各种背door 净化技术来净化受害模型。尽管取得了显著成果,但当前最先进 (SOTA) 的背door 净化技术通常依赖于小型干净数据集,通常称为辅助数据集。然而,在实际应用中获取理想的辅助数据集是一个重大挑战。本研究首先评估了不同类型的真实世界辅助数据集上的 SOTA 背door 净化技术。我们的发现表明,净化效果会因所使用的辅助数据集类型而显著波动。具体而言,高质量的分布内辅助数据集对于有效净化至关重要,而来自不同或超出分布的数据集会显著降低防御性能。基于此,我们提出了引导输入校准 (GIC),旨在通过采用可学习变换来提高净化效果。由受害模型本身引导,GIC 将辅助数据集的特征与原始训练集的特征对齐。 comprehensive 实验表明,GIC 可以在多样化的辅助数据集类型上显著提升净化性能。代码和数据将通过 https://github.com/shawkui/BackdoorBenchER 提供。

关键词

引用

@article{arxiv.2502.07231,
  title  = {Revisiting the Auxiliary Data in Backdoor Purification},
  author = {Shaokui Wei and Shanchao Yang and Jiayin Liu and Hongyuan Zha},
  journal= {arXiv preprint arXiv:2502.07231},
  year   = {2025}
}

备注

Preprint. Code and data are being finalized and will be released incrementally