Δ-Influence:通过影响函数消除投毒
计算机视觉与模式识别
2025-10-21 v2 密码学与安全
机器学习
摘要
针对数据完整性挑战,例如在模型训练后忘却数据投毒的影响,对于可靠部署机器学习模型至关必要。现有影响函数(如 EK-FAC 和 TRAK)常常无法准确地将异常模型行为归因于特定的受投毒训练数据。此外,传统的忘却算法往往难以有效移除受投毒样本的影响,尤其当只能识别出少数受影响的示例时。为此,我们引入 Δ-Influence,一种新方法,利用影响函数将异常模型行为追溯到负责数据投毒攻击的受投毒训练数据,仅需一个受投毒测试示例。Δ-Influence 通过数据转换手段,切断受投毒训练数据与受损测试点之间的关联,而对干净数据影响不大。这使 Δ-Influence 能够检测数据转换后影响分数出现的显著负向偏移,我们称之为影响坍缩,从而准确识别受投毒的训练数据。通过对该子集进行忘却(例如通过重新训练),可有效消除数据投毒。我们在三个基于视觉的投毒攻击和三个数据集上对方法进行验证,分别对比了五种检测算法和五种忘却策略。我们显示,Δ-Influence 在所有设置下均实现最佳忘却效果,表明影响函数在纠正性忘却中具有潜力。我们的代码已公开:https://github.com/Ruby-a07/delta-influence
引用
@article{arxiv.2411.13731,
title = {Delta-Influence: Unlearning Poisons via Influence Functions},
author = {Wenjie Li and Jiawei Li and Pengcheng Zeng and Christian Schroeder de Witt and Ameya Prabhu and Amartya Sanyal},
journal= {arXiv preprint arXiv:2411.13731},
year = {2025}
}
备注
Accepted at NeurIPS Workshop on Attributing Model Behavior at Scale (ATTRIB @ NeurIPS 2024)