面向群体分布偏移的黑盒审计
机器学习
2022-09-09 v1 密码学与安全
计算机与社会
摘要
当模型用于对人的决策时,分布偏移可能造成不公正的差异。然而,外部实体很难检查分布偏移,因为模型及其训练集通常是专有的。本文中,我们引入并研究了一种黑盒审计方法,用于检测导致模型在不同人口群体间性能差异的分布偏移情况。通过扩展成员推断攻击与属性推断攻击中使用的技术——这些技术旨在从已学习模型中暴露私有信息——我们证明外部审计者仅通过查询模型即可获得识别这些分布偏移所需的信息。我们在真实世界数据集上的实验结果表明,该方法有效,在检测涉及训练集中某个人口群体代表性不足的分布偏移时达到80–100%的AUC-ROC。研究人员与调查记者可使用我们的工具对专有模型进行非协作审计,并揭露训练数据集中的代表性不足案例。
引用
@article{arxiv.2209.03620,
title = {Black-Box Audits for Group Distribution Shifts},
author = {Marc Juarez and Samuel Yeom and Matt Fredrikson},
journal= {arXiv preprint arXiv:2209.03620},
year = {2022}
}