基于先验知识的鲁棒机器学习审计
机器学习
2025-05-26 v2
摘要
在强制执行AI监管方面,审计操纵风险是众多技术挑战中一个关键但未被充分探讨的问题。这种操纵发生在平台故意改变其对监管机构的回答以通过审计,而对其他用户保持原样的情况。本文引入一种新颖的防操纵审计方法,通过考虑监管者对平台所解决任务的先验知识。我们首先演示,监管者不能依赖公共先验(例如公共数据集),因为平台可以轻易欺骗此类情况下的审计员。随后,我们形式化地建立了监管者在掌握关于真实答案的先验知识时防止审计操纵的条件。最后,我们通过两个标准数据集的实验说明,平台在被检测为恶意之前能够隐藏的最大不公平程度。我们对基于先验知识的防操纵审计进行的形式化与推广,为更健壮的公平性审计开辟了新的研究方向。
引用
@article{arxiv.2505.04796,
title = {Robust ML Auditing using Prior Knowledge},
author = {Jade Garcia Bourrée and Augustin Godinot and Martijn De Vos and Milos Vujasinovic and Sayan Biswas and Gilles Tredan and Erwan Le Merrer and Anne-Marie Kermarrec},
journal= {arXiv preprint arXiv:2505.04796},
year = {2025}
}
备注
Accepted to the 42nd International Conference on Machine Learning ICML25