具有代表性与公平性的合成数据
机器学习
2021-04-08 v1 机器学习
摘要
算法基于其所接触的训练数据学习规则和关联。然而,正是这些教导机器理解和预测世界的数据,包含了社会和历史性偏见,导致带有偏见的算法,并在用于决策支持时存在进一步放大这些偏见的风险。另一方面,合成数据应运而生,有望提供无限量的代表性、真实训练样本,且可进一步共享而不泄露个体主体的隐私。我们提出一个将公平性约束纳入自监督学习过程的框架,该框架允许随后模拟无限量的具有代表性且公平的合成数据。该框架提供了一个在 AI 源头即训练数据处管控和校正隐私与偏见的手段。我们通过改进现有的生成模型架构并生成 UCI Adult 人口普查数据集的代表性且公平的版本来演示所提方法。在忠实保留属性间关系的同时,对原始数据中固有的性别和种族偏见进行了控制。通过在原始数据训练的下游预测模型与公平合成数据训练的下游预测模型之间比较倾向得分,进一步验证了这一点。我们认为具有代表性与公平性的合成数据是未来一个有前景的构建模块,用以教导算法不是基于历史世界,而是基于我们力求生活的世界。
引用
@article{arxiv.2104.03007,
title = {Representative & Fair Synthetic Data},
author = {Paul Tiwald and Alexandra Ebert and Daniel T. Soukup},
journal= {arXiv preprint arXiv:2104.03007},
year = {2021}
}