中文

引入一系列用于机器学习偏差研究的合成数据集

机器学习 2021-08-05 v2 密码学与安全 机器学习

摘要

机器学习(ML)偏差研究进展的一大障碍是相关数据集的可用性。鉴于此类数据的敏感性,这种情况不太可能有很大改观。因此,合成数据在该研究中可发挥作用。在这篇短文中,我们提出这样一个合成数据集族。我们概述了数据,描述了偏差水平如何调节,并给出了一个基于该数据的简单实验示例。

关键词

引用

@article{arxiv.2107.08928,
  title  = {Introducing a Family of Synthetic Datasets for Research on Bias in Machine Learning},
  author = {William Blanzeisky and Pádraig Cunningham and Kenneth Kennedy},
  journal= {arXiv preprint arXiv:2107.08928},
  year   = {2021}
}