中文

为合成数据辩护

数据库 2019-05-07 v1

摘要

合成数据集长期被视为二流的,仅在无法直接采集自真实世界的“真实”数据不可用时才使用。但这一观点假定原始数据是干净、无偏且可信的,而事实很少如此。此外,在任何涉及人的领域中,合成数据在隐私保护和偏差校正方面的益处正变得愈发重要。经过筛选的合成数据集——由对真实数据的极小扰动派生出的合成数据——支持早期产品开发与协作,保护隐私,提供可复现性,增加研究中的数据集多样性,并保护弱势群体制止基于反映系统性歧视的原始数据的问题推断。本文认为,恰当生成的合成数据并非偏离世界真实状态,而是迈向负责任且公平的机器学习系统研发的一步。

关键词

引用

@article{arxiv.1905.01351,
  title  = {In Defense of Synthetic Data},
  author = {Luke Rodriguez and Bill Howe},
  journal= {arXiv preprint arXiv:1905.01351},
  year   = {2019}
}

备注

Discussion paper at FATES on the Web 2019