中文

多合成数据集集成的偏差 - 方差分解

机器学习 2025-04-28 v3 机器学习

摘要

最近的研究强调了为监督学习生成多个合成数据集的好处,从提高准确性到更有效的模型选择和不确定性估计。这些好处有明确的实证支持,但目前对其理论理解非常薄弱。我们试图通过推导使用多个合成数据集的几种设置(包括差分隐私合成数据)的偏差 - 方差分解来增加理论理解。我们的理论得出了一个简单的经验法则,用于在均方误差和 Brier 分数情况下选择合适的合成数据集数量。我们使用多个真实数据集、下游预测器和误差指标研究了我们的理论在实际中的效果。正如我们的理论所预测,多个合成数据集通常能提高准确性,而单个大型合成数据集最多只能提供微小的改进,这表明我们的见解具有实际相关性。

关键词

引用

@article{arxiv.2402.03985,
  title  = {A Bias-Variance Decomposition for Ensembles over Multiple Synthetic Datasets},
  author = {Ossi Räisä and Antti Honkela},
  journal= {arXiv preprint arXiv:2402.03985},
  year   = {2025}
}

备注

AISTATS 2025