中文

面向公平表示的投毒攻击

机器学习 2024-03-06 v2

摘要

公平机器学习旨在缓解模型预测对特定人口子群(如老年人与女性)的偏差。近来,由深度神经网络训练的公平表示学习(Fair Representation Learning, FRL)展现出优越性能,其从数据中推断出不含人口统计信息的表示,并用作分类或其他下游任务的输入。尽管 FRL 方法有所发展,但其在数据投毒攻击(一种在对抗场景下基准测试模型鲁棒性的流行协议)下的脆弱性尚未被充分探索。针对将公平约束纳入浅层模型分类器的经典公平机器学习方法,已有数据投毒攻击被提出。然而,由于公平性目标与模型架构的显著差异,这些攻击在 FRL 中失效。本工作提出首个攻击 FRL 的数据投毒框架。我们通过向训练数据注入精心构造的投毒样本,诱导模型输出包含尽可能多人口统计信息的不公平表示。该攻击涉及 prohibitive 的双层优化,为此提出一种有效的近似解。推导了关于所需投毒样本数量的理论分析,并为防御该攻击提供启示。在基准公平数据集与最先进公平表示学习模型上的实验证明了我们攻击的优越性。

关键词

引用

@article{arxiv.2309.16487,
  title  = {Towards Poisoning Fair Representations},
  author = {Tianci Liu and Haoyu Wang and Feijie Wu and Hengtong Zhang and Pan Li and Lu Su and Jing Gao},
  journal= {arXiv preprint arXiv:2309.16487},
  year   = {2024}
}