用于防御标签投毒攻击的对抗训练
机器学习
2025-02-25 v1 人工智能
摘要
随着机器学习模型复杂度的增加以及日益依赖公开来源的数据(例如训练大型语言模型时使用的人工标注标签),它们变得更容易受到标签投毒攻击。在这类攻击中,攻击者会巧妙地篡改训练数据集中的标签,这会严重降低模型性能,在关键应用中构成重大风险。在本文中,我们提出了 FLORAL,一种基于支持向量机(SVM)的新型对抗训练防御策略,以应对这些威胁。利用双层优化框架,我们将训练过程构建为攻击者与模型之间的非零和 Stackelberg 博弈,其中攻击者策略性地投毒关键训练标签,而模型则试图从此类攻击中恢复。我们的方法适用于各种模型架构,并采用带核支持向量机的投影梯度下降算法进行对抗训练。我们对算法的收敛性质进行了理论分析,并在多种分类任务上实证评估了 FLORAL 的有效性。与鲁棒基线和 RoBERTa 等基础模型相比,在不断增加的攻击者预算下,FLORAL 始终获得更高的鲁棒准确率。这些结果突显了 FLORAL 在增强机器学习模型抵御标签投毒威胁方面的潜力,从而确保在对抗环境下的鲁棒分类。
引用
@article{arxiv.2502.17121,
title = {Adversarial Training for Defense Against Label Poisoning Attacks},
author = {Melis Ilayda Bal and Volkan Cevher and Michael Muehlebach},
journal= {arXiv preprint arXiv:2502.17121},
year = {2025}
}
备注
Accepted at the International Conference on Learning Representations (ICLR 2025)