中文

通过披露受控代理实现的平衡筛选

机器学习 2024-06-19 v3

摘要

我们研究在部署时敏感群体成员信息不可用或禁止使用时,收集关于敏感群体平衡的队列或集合的问题。具体而言,我们的部署时收集机制不会比仅从基础比率可确定的信息更多地揭示任何个体样本的群体成员信息。为此,我们研究了一种学习器,其可使用一小部分标注数据训练代理函数,随后用于该筛选或选择任务。接着我们将代理函数的取值范围与采样概率相关联;给定新样本,我们用代理函数对其分类,然后以其代理分类对应的概率选中它。重要的是,我们要求代理分类相比总体基础比率单独而言不会显著更多地揭示任何个体样本的敏感群体成员信息(即披露水平应受控),并表明我们能以样本高效和预言机高效的方式找到此类代理。最后,我们通过实验评估了我们的算法并分析了其泛化性质。

关键词

引用

@article{arxiv.2306.15083,
  title  = {Balanced Filtering via Disclosure-Controlled Proxies},
  author = {Siqi Deng and Emily Diana and Michael Kearns and Aaron Roth},
  journal= {arXiv preprint arXiv:2306.15083},
  year   = {2024}
}