多合成数据集集成的偏差 - 方差分解
机器学习
2025-04-28 v3 机器学习
摘要
最近的研究强调了为监督学习生成多个合成数据集的好处,从提高准确性到更有效的模型选择和不确定性估计。这些好处有明确的实证支持,但目前对其理论理解非常薄弱。我们试图通过推导使用多个合成数据集的几种设置(包括差分隐私合成数据)的偏差 - 方差分解来增加理论理解。我们的理论得出了一个简单的经验法则,用于在均方误差和 Brier 分数情况下选择合适的合成数据集数量。我们使用多个真实数据集、下游预测器和误差指标研究了我们的理论在实际中的效果。正如我们的理论所预测,多个合成数据集通常能提高准确性,而单个大型合成数据集最多只能提供微小的改进,这表明我们的见解具有实际相关性。
引用
@article{arxiv.2402.03985,
title = {A Bias-Variance Decomposition for Ensembles over Multiple Synthetic Datasets},
author = {Ossi Räisä and Antti Honkela},
journal= {arXiv preprint arXiv:2402.03985},
year = {2025}
}
备注
AISTATS 2025