基于梯度训练的数据投毒认证鲁棒性
机器学习
2024-10-31 v2 密码学与安全
计算机视觉与模式识别
摘要
现代机器学习管道利用大量公共数据,难以保证数据质量,使模型暴露于投毒和后门攻击之下。在此背景下,对模型在此类攻击下的行为进行可证明的界限仍是开放问题。本文通过开发首个在不修改模型或学习算法的前提下,对使用可能被操控数据的模型行为提供可证明保证的框架来解决此挑战。具体而言,我们的框架对针对受控和非针对性投毒以及后门攻击的鲁棒性提供了证明,适用于训练输入和标签的受限和不受限操控。我们的方法利用凸松弛来过度近似给定投毒威胁模型的所有可能参数更新,从而允许我们界定基于任意梯度学习算法的所有可达参数的集合。基于此参数集合,我们提供对最坏情况行为的界限,包括模型性能和后门成功率。我们在能源消耗、医学成像和自动驾驶等多个实际数据集上演示了我们的方案。
引用
@article{arxiv.2406.05670,
title = {Certified Robustness to Data Poisoning in Gradient-Based Training},
author = {Philip Sosnin and Mark N. Müller and Maximilian Baader and Calvin Tsay and Matthew Wicker},
journal= {arXiv preprint arXiv:2406.05670},
year = {2024}
}
备注
21 pages, 8 figures