中文

利用重归一化影响估计识别训练集攻击的目标

机器学习 2022-09-07 v2 密码学与安全

摘要

定向训练集攻击向训练集中注入恶意样本,使训练后的模型对一个或多个特定测试样本误分类。本文提出目标识别任务,即判定某个特定测试样本是否为训练集攻击的目标。目标识别可与对抗样本识别相结合,以发现(并移除)攻击样本,从而在对其他预测影响最小的情况下缓解攻击。我们并非聚焦于单一攻击方法或数据模态,而是基于影响估计——其量化每个训练样本对模型预测的贡献。我们表明,现有影响估计器实际性能不佳常源于其过度依赖具有大损失的训练样本与迭代。我们的重归一化影响估计器修复了该弱点;在对抗与非对抗场景下,它们在识别有影响力的训练样本组上远优于原始估计器,甚至能在无干净数据误报的情况下找出多达 100% 的对抗训练样本。目标识别随后简化为检测具有异常影响值的测试样本。我们在后门与投毒攻击上跨文本、视觉、语音等多种数据域展示了方法的有效性,还包括针对专门优化对抗样本以规避我们方法的灰盒自适应攻击者。我们的源代码见 https://github.com/ZaydH/target_identification。

关键词

引用

@article{arxiv.2201.10055,
  title  = {Identifying a Training-Set Attack's Target Using Renormalized Influence Estimation},
  author = {Zayd Hammoudeh and Daniel Lowd},
  journal= {arXiv preprint arXiv:2201.10055},
  year   = {2022}
}

备注

Accepted at CCS'2022 -- Extended version including the supplementary material