中文

密度感知的样本特定攻击

机器学习 2026-05-29 v2 密码学与安全

摘要

尽管后门攻击近期取得了进展,现有方法仍然容易受到通过微调或剪枝来擦除后门的训练后防御的影响。我们重新审视了后门攻击的核心目标,并在受害者训练的贝叶斯最优模型下推导出刻画最优样本特定触发器构建的原则性标准。我们的分析表明,当触发样本被引导至干净数据分布的低密度区域时,攻击成功率和干净准确率保持同时得到优化,这是一种分布条件,它一次性控制了中毒分布的所有矩,而非少数输入空间汇总统计量。我们引入了一个双层优化框架,通过条件时间分数匹配估计密度比,并优化一个混合模型目标以将触发样本放置在这些稀疏区域。在MNIST、CIFAR-10、GTSRB和TinyImageNet上的大量评估表明,我们的方法在防御前实现了超过99%的攻击成功率,并且在微调防御下,防御后的攻击成功率(ASR)比最强基线高出50-85个百分点。针对神经元剪枝防御,该方法表现出完全免疫性,在所有剪枝阈值下均未识别出任何需要移除的神经元。这些结果暴露了当前防御范式中的根本性差距,并强调了需要开发在干净分布支撑集之外运作的防御方法。

关键词

引用

@article{arxiv.2605.27809,
  title  = {Density-aware Sample-specific Attack},
  author = {Qiyuan Wang and Yao Li and Raymond K. W. Wong},
  journal= {arXiv preprint arXiv:2605.27809},
  year   = {2026}
}