中文

观点:重新审视合成数据分类的隐私视角

机器学习 2025-08-07 v4 人工智能

摘要

合成数据正成为满足人工智能开发日益增长的数据需求的一种具有成本效益的解决方案,它要么从现有知识中创建,要么从真实数据中衍生而来。将合成数据类型传统分类为混合、部分或完全合成数据集的价值有限,且无法反映日益增长的合成数据生成方法。生成方法及其来源共同塑造了合成数据的特性,进而决定了其实际应用。我们提出了一种对合成数据类型进行分组的替代方法,该方法更好地反映了隐私视角,以便为合成数据的生成和处理提供监管指导。这种分类方法为深度生成方法等新进展提供了灵活性,并为未来应用提供了更实用的框架。

关键词

引用

@article{arxiv.2503.03506,
  title  = {Opinion: Revisiting synthetic data classifications from a privacy perspective},
  author = {Vibeke Binz Vallevik and Serena Elizabeth Marshall and Aleksandar Babic and Jan Franz Nygaard},
  journal= {arXiv preprint arXiv:2503.03506},
  year   = {2025}
}