合成数据生成的效用理论
机器学习
2025-04-04 v4 机器学习
摘要
合成数据算法在工业界被广泛用于为下游学习任务生成人工数据。现有研究主要聚焦于经验性评估合成数据的效用,其理论理解则大为匮乏。本文通过在统计学习框架中建立相关效用理论,弥合了实践与理论间的鸿沟。其考虑了两种效用度量:在合成数据上训练模型的泛化性与模型排序。前者定义为在合成数据与真实数据上训练模型的泛化差异。通过推导该效用度量的解析界,我们表明只要下游学习任务中模型设定得当,为确保合成模型具有可比泛化性,合成特征分布无需与真实数据分布相似。后一种效用度量研究在合成数据上训练模型的相对性能。特别地,我们发现为确保一致的模型比较,合成数据分布未必需要与真实分布相似。有趣的是,即使合成响应生成不佳,只要下游模型可由泛化差距分离,一致的模型比较仍可实现。最后,我们在非参数模型与深度神经网络上进行了大量实验以验证这些理论发现。
引用
@article{arxiv.2305.10015,
title = {Utility Theory of Synthetic Data Generation},
author = {Shirong Xu and Will Wei Sun and Guang Cheng},
journal= {arXiv preprint arXiv:2305.10015},
year = {2025}
}