虚假数据的真实风险:合成数据、多样性掩饰与同意规避
计算机与社会
2024-05-06 v1 人工智能
计算机视觉与模式识别
摘要
机器学习系统需要对现实世界的表征用于训练和测试——它们需要数据,还需要大量数据。规模收集数据的做法面临程序和伦理挑战,合成数据为这些挑战提供了解方。相较于收集真实人脸照片以训练面部识别系统,模型创建者可以使用照片逼真的合成人脸。生成这类合成数据的相对容易程度已使其成为常见做法。我们提出了在模型开发中使用合成数据的两个关键风险。首先,我们详细阐述了使用合成数据提高数据多样性和代表性时产生的虚假信心的高风险。我们基于合成数据实际应用案例进行论证,其中为面部识别技术的评估生成了合成数据集。其次,我们审视了使用合成数据如何风险规避数据使用同意的问题。我们通过考虑 U.S. 联邦贸易委员会 (FTC) 规范数据收集的重要性来说明这一点。最后,我们讨论了这两个风险如何体现合成数据复杂化现有治理和伦理实践的现象;通过将数据从其影响对象中解耦,合成数据容易巩固权力,使其远离受算法中介性伤害影响最大化的人群。
引用
@article{arxiv.2405.01820,
title = {Real Risks of Fake Data: Synthetic Data, Diversity-Washing and Consent Circumvention},
author = {Cedric Deslandes Whitney and Justin Norman},
journal= {arXiv preprint arXiv:2405.01820},
year = {2024}
}