抽象梯度训练:面向数据投毒、遗忘与差分隐私的统一认证框架
机器学习
2025-11-13 v1
摘要
推理时间数据扰动(如对抗性攻击)的影响已在机器学习领域得到广泛研究,导致针对对抗鲁棒性的认证技术已相当成熟。相比之下,针对训练数据扰动的认证仍是相对未被充分探索的领域。这些扰动可源自三个关键情境:对抗性数据投毒——攻击者操纵训练样本以破坏模型性能;机器遗忘——需要认证在删除特定训练数据后模型的行为;差分隐私——必须就替换单个数据点提供保证。本工作引入抽象梯度训练(AGT),一个统一框架,用于认证给定模型和训练程序对训练数据扰动的鲁棒性,包括有界扰动、数据点删除以及新样本的添加。通过对可达参数集进行界限化(即建立可证明的参数空间界限),AGT为分析通过一阶优化方法训练的模型行为提供了形式化方法。
引用
@article{arxiv.2511.09400,
title = {Abstract Gradient Training: A Unified Certification Framework for Data Poisoning, Unlearning, and Differential Privacy},
author = {Philip Sosnin and Matthew Wicker and Josh Collyer and Calvin Tsay},
journal= {arXiv preprint arXiv:2511.09400},
year = {2025}
}