探索模型动态以发现累积式投毒
机器学习
2023-06-07 v1 密码学与安全
摘要
对抗式投毒攻击对各类机器学习应用构成巨大威胁。尤其是,近期的累积式投毒攻击表明,可通过一系列难以察觉的攻击随后接一个触发批次,对模型造成不可修复的损害。由于实时数据流中数据层面的差异有限,当前的防御方法在处理投毒样本与干净样本时缺乏区分性。本文从模型动态的角度出发,提出一种新颖的信息度量,即记忆差异(Memorization Discrepancy),通过模型层面的信息探索防御方法。通过将数据操纵中的变化隐式转移到模型输出的变化中,记忆差异可基于投毒样本与干净样本截然不同的动态来发现难以察觉的投毒样本。我们深入探究了其性质,并提出差异感知样本校正(DSC)以防御累积式投毒攻击。大量实验全面刻画了记忆差异并验证了其实效性。代码已公开于:https://github.com/tmlr-group/Memorization-Discrepancy。
引用
@article{arxiv.2306.03726,
title = {Exploring Model Dynamics for Accumulative Poisoning Discovery},
author = {Jianing Zhu and Xiawei Guo and Jiangchao Yao and Chao Du and Li He and Shuo Yuan and Tongliang Liu and Liang Wang and Bo Han},
journal= {arXiv preprint arXiv:2306.03726},
year = {2023}
}
备注
accepted by ICML 2023