为合成数据辩护
数据库
2019-05-07 v1
摘要
合成数据集长期被视为二流的,仅在无法直接采集自真实世界的“真实”数据不可用时才使用。但这一观点假定原始数据是干净、无偏且可信的,而事实很少如此。此外,在任何涉及人的领域中,合成数据在隐私保护和偏差校正方面的益处正变得愈发重要。经过筛选的合成数据集——由对真实数据的极小扰动派生出的合成数据——支持早期产品开发与协作,保护隐私,提供可复现性,增加研究中的数据集多样性,并保护弱势群体制止基于反映系统性歧视的原始数据的问题推断。本文认为,恰当生成的合成数据并非偏离世界真实状态,而是迈向负责任且公平的机器学习系统研发的一步。
引用
@article{arxiv.1905.01351,
title = {In Defense of Synthetic Data},
author = {Luke Rodriguez and Bill Howe},
journal= {arXiv preprint arXiv:1905.01351},
year = {2019}
}
备注
Discussion paper at FATES on the Web 2019