针对数据归因的对抗攻击
机器学习
2025-05-20 v4
摘要
数据归因旨在量化单个训练数据点对 AI 模型输出的贡献,已被用于衡量训练数据的价值并补偿数据提供者。鉴于其对财务决策和补偿机制的影响,关于数据归因方法的对抗鲁棒性成为了一个关键问题。然而,目前几乎没有针对该问题的系统性研究。在本工作中,我们旨在通过详细描述一个威胁模型来填补这一空白,该模型对敌手的目标和能力有明确的假设,并提出了有原则的针对数据归因的对抗攻击方法。我们提出了两种方法:Shadow Attack 和 Outlier Attack,它们生成被操纵的数据集以对抗性地夸大补偿。Shadow Attack 利用有关 AI 应用中数据分布的知识,并通过“影子训练”(一种常用于成员推理攻击的技术)推导出对抗扰动。相反,Outlier Attack 不假设对数据分布有任何了解,仅依赖于对目标模型预测的黑盒查询。它利用了许多数据归因方法中存在的一种归纳偏置——离群数据点更有可能具有影响力——并采用对抗样本来生成被操纵的数据集。实验表明,在图像分类和文本生成任务中,Shadow Attack 可以将基于数据归因的补偿夸大至少 200%,而 Outlier Attack 实现的补偿夸大范围从 185% 到高达 643%。我们的实现可在 https://github.com/TRAIS-Lab/adversarial-attack-data-attribution 获取。
引用
@article{arxiv.2409.05657,
title = {Adversarial Attacks on Data Attribution},
author = {Xinhe Wang and Pingbang Hu and Junwei Deng and Jiaqi W. Ma},
journal= {arXiv preprint arXiv:2409.05657},
year = {2025}
}
备注
Accepted at the 13th International Conference on Learning Representations (ICLR 2025)