引入一系列用于机器学习偏差研究的合成数据集
机器学习
2021-08-05 v2 密码学与安全
机器学习
摘要
机器学习(ML)偏差研究进展的一大障碍是相关数据集的可用性。鉴于此类数据的敏感性,这种情况不太可能有很大改观。因此,合成数据在该研究中可发挥作用。在这篇短文中,我们提出这样一个合成数据集族。我们概述了数据,描述了偏差水平如何调节,并给出了一个基于该数据的简单实验示例。
引用
@article{arxiv.2107.08928,
title = {Introducing a Family of Synthetic Datasets for Research on Bias in Machine Learning},
author = {William Blanzeisky and Pádraig Cunningham and Kenneth Kennedy},
journal= {arXiv preprint arXiv:2107.08928},
year = {2021}
}