中文

从真实数据到合成数据的过渡:模型中偏见的量化

机器学习 2021-05-11 v1

摘要

随着生成建模技术的出现,合成数据及其使用已渗透到从图像、文本等非结构化数据到医疗结果、金融领域风险决策等结构化数据集建模的多个领域。它克服了诸多挑战,如训练数据有限、类别不平衡、因隐私问题导致的数据集访问受限。为确保用于自动化决策目的的训练模型做出公平决策,已有先前工作对这些问题进行量化和缓解。本研究旨在建立使用合成数据训练的模型中偏见与公平性之间的权衡。我们研究了包括差分隐私生成方案在内的多种合成数据生成技术变体,以理解偏见放大。通过在表格数据集上的实验,我们证明了使用合成数据训练的模型存在不同程度的偏见影响。正如公平性指标所显示的,生成特征相关性较低的技术表现良好,其DPD(人口均等差异)、EoD(机会均等)和EoP(机会平等)分别相对下降94%、82%和88%,且DRP(人口均等比率)相对于真实数据集相对提升24%。我们相信本研究的结果将有助于数据科学从业者理解合成数据使用中的偏见。

关键词

引用

@article{arxiv.2105.04144,
  title  = {Transitioning from Real to Synthetic data: Quantifying the bias in model},
  author = {Aman Gupta and Deepak Bhatt and Anubha Pandey},
  journal= {arXiv preprint arXiv:2105.04144},
  year   = {2021}
}

备注

Accepted at Synthetic Data Generation Workshop at ICLR 2021 https://sdg-quality-privacy-bias.github.io/papers/