中文

面向中毒攻击的公平分类防御

机器学习 2022-10-19 v1 密码学与安全

摘要

公平分类旨在强调分类模型以实现不同敏感群体间的平等(对待或预测质量)。然而,公平分类可能面临中毒攻击的风险,此类攻击通过故意插入恶意训练样本来操纵所训练分类器的性能。在本工作中,我们研究了一种中毒场景:攻击者可向训练数据中插入一小部分样本,这些样本具有任意敏感属性及其他预测特征。我们证明,即便应用一些最有效的防御方法(原本用于防御传统分类任务),公平训练的分类器对此类中毒攻击仍高度脆弱,其准确率与公平性权衡显著恶化。作为防御公平分类任务的对抗措施,我们提出了一个通用且具理论保证的框架,该框架使传统防御方法适用于抵御中毒攻击的公平分类。大量实验结果表明,所提出的防御框架在准确率和公平性方面均比代表性基线方法具有更好的鲁棒性。

关键词

引用

@article{arxiv.2210.09503,
  title  = {Towards Fair Classification against Poisoning Attacks},
  author = {Han Xu and Xiaorui Liu and Yuxuan Wan and Jiliang Tang},
  journal= {arXiv preprint arXiv:2210.09503},
  year   = {2022}
}