应不应该为此任务使用合成数据?合成数据在数据共享与数据增强中的适用性分析
机器学习
2026-02-04 v1 计算机与社会
摘要
近期的生成式建模技术推动了许多人将合成数据视为解决数据访问、稀缺性和欠代表性问题的首选方案。本文我们研究了三个突出的用例:(1)将合成数据作为专有数据集的代理,用于在保护隐私的同时启用统计分析;(2)通过合成数据增强机器学习训练集以提高模型性能;(3)通过合成数据增强数据集以减少统计估计的方差。对于每个用例,我们形式化了问题设置并通过形式化分析和案例研究,在合成数据能够实现其预期目标的条件下进行研究。我们识别出限制合成数据在特定问题中发挥有效作用的根本性和实用性限制。我们的分析表明,由于这些限制,许多现有的或构想中的合成数据用例都不是良好的问题匹配。我们对合成数据用例的形式化和分类使决策者能够评估合成数据是否适合其特定的数据可用性问题。
引用
@article{arxiv.2602.03791,
title = {Should I use Synthetic Data for That? An Analysis of the Suitability of Synthetic Data for Data Sharing and Augmentation},
author = {Bogdan Kulynych and Theresa Stadler and Jean Louis Raisaro and Carmela Troncoso},
journal= {arXiv preprint arXiv:2602.03791},
year = {2026}
}
备注
BK and TS contributed equally