中文

通过公平合成数据实现强统计 parity

机器学习 2023-11-07 v1 计算机与社会 机器学习

摘要

AI 生成的合成数据除了保护原始数据集的隐私外,还允许用户和数据使用者根据自身需求定制数据。本文探索了体现“设计即公平”(Fairness by Design)的合成数据创建方法,重点关注统计 parity 公平性定义。通过在不同敏感属性间均衡合成数据生成器所学到的目标概率分布,在此类合成数据上训练的下游模型可在所有阈值下提供公平预测,即即使从有偏的原始数据进行推断也能实现强公平预测。该公平性调整既可直接集成到合成生成器的采样过程中,也可作为后处理步骤添加。这种灵活性使数据使用者能够创建公平的合成数据,并在无需对数据做任何先验假设或重新训练合成数据生成器的情况下,微调准确性与公平性之间的权衡。

关键词

引用

@article{arxiv.2311.03000,
  title  = {Strong statistical parity through fair synthetic data},
  author = {Ivona Krchova and Michael Platzer and Paul Tiwald},
  journal= {arXiv preprint arXiv:2311.03000},
  year   = {2023}
}