中文

暴露公平性幻象:对分布式操纵攻击的安全审计

机器学习 2026-03-10 v2 最优化与控制 应用统计

摘要

AI 系统在高风险领域的快速部署,包括欧盟 AI 法规(Regulation (EU) 2024/1689)所分类的高风险领域,加剧了对合规性审计的可靠需求。对于二分类器,监管风险评估通常依赖于全局公平性指标,如常见用于评估潜在歧视的差异影响比率。在典型的审计场景中,审计对象向审计员提供其数据子集,而监督当局可能验证该子集是否代表完整底层分布。在本研究中,我们调查了恶意审计对象如何构建符合公平性要求却呈似乎代表性的样本,从而制造出公平性幻象。我们将此问题形式化为受约束的分布投射任务,引入基于信息熵和最优传输投影的数学依据操纵策略。这些构建刻画了满足公平约束所需的最小分布偏移。为对抗此类攻击,我们通过基于分布距离的统计检验形式化代表性,并系统评估其检测被操纵样本的能力。我们的分析揭示了公平性操纵在统计上难以被察觉的条件,并为加强监督性验证提供了实用指南。我们通过标准表格数据集上的实验验证了理论发现。代码已公开于 https://github.com/ValentinLafargue/Inspection。

关键词

引用

@article{arxiv.2507.20708,
  title  = {Exposing the Illusion of Fairness: Auditing Vulnerabilities to Distributional Manipulation Attacks},
  author = {Valentin Lafargue and Adriana Laurindo Monteiro and Emmanuelle Claeys and Laurent Risser and Jean-Michel Loubes},
  journal= {arXiv preprint arXiv:2507.20708},
  year   = {2026}
}