中文

对抗偏置:数据投毒攻击下的公平性

机器学习 2025-11-12 v1

摘要

随着AI和机器学习系统在现实应用中的广泛采用,确保其公平性正变得越来越关键。算法公平性研究的主要集中在评估和改善机器学习系统的公平性方面,关于公平性脆弱性(即AI系统公平性如何被有意破坏)的研究相对较少。本文首先提供了理论分析,表明简单的对抗性投毒策略足以在naive贝叶斯分类器中诱导最大不公平行为。我们的关键思想是战略性地向训练集注入少量精心设计的对抗性数据点,从而偏向模型决策边界,使受保护群体受到不成比例的影响,同时保持可泛化的性能。为说明该方法的实际有效性,我们在多个基准数据集和模型上进行实验。我们发现,该攻击在多个模型和数据集上在降低公平性指标方面显著优于现有方法,通常以可接受的精度损失实现更高的不公平程度。值得注意的是,我们的方法在广泛的模型范围内有效,与先前工作不同,表明一种稳健且高效的破坏机器学习系统公平性的方法。

关键词

引用

@article{arxiv.2511.08331,
  title  = {Adversarial Bias: Data Poisoning Attacks on Fairness},
  author = {Eunice Chan and Hanghang Tong},
  journal= {arXiv preprint arXiv:2511.08331},
  year   = {2025}
}

备注

15 pages, 9 figures, shortened version in BigData 2025