利用不完美来源检测黑盒审计中的公平性清洗
机器学习
2026-03-18 v3 计算机与社会
软件工程
摘要
在《人工智能法案》和《数字服务法案》等框架下,算法审计已成为平台问责的核心。在实践中,这一义务通过专用的审计 API 来履行。这种架构造成了一个悖论:受审查的实体控制着评估接口。面临法律制裁的平台可以在其审计 API 上提供一个合规的替代模型,同时运行一个有歧视性的生产系统。这种欺骗性做法被称为公平性清洗(fairwashing)。如果审计员仅依赖单一来源,操纵行为是无法被检测到的。为解决这一局限,我们引入了双来源审计模型(2SAM)。该模型将审计 API 与一个独立的受信任流进行交叉比对。其核心见解是,受信任流无需与审计 API 完美对齐。我们引入了一致性代理,一种可以调和来源间差异的概率映射。该方法产生了三个结果。首先,我们量化了单一来源审计员盲目(无法察觉)的操纵率阈值。其次,我们展示了代理质量如何支配检测能力。第三,我们提供了一个闭式预算条件,可在任意目标置信水平下保证检测,从而消除上述盲点。我们在 UCI Adult 数据集上验证了 2SAM,在使用基于姓名的性别代理(准确率 94.2%)的情况下,于总计 750 次查询预算中仅用 127 次交叉验证查询即实现了 70% 的检测能力。
引用
@article{arxiv.2305.13883,
title = {Leveraging Imperfect Sources to Detect Fairwashing in Black-Box Auditing},
author = {Jade Garcia Bourrée and Erwan Le Merrer and Gilles Tredan and Benoît Rottembourg},
journal= {arXiv preprint arXiv:2305.13883},
year = {2026}
}
备注
23 pages, 10 figures