中文

集成的成本:是否总是值得组合?

机器学习 2025-07-10 v2 应用统计 其他统计学

摘要

随着数据集规模的不断增大和预测模型的复杂性提升,预测准确率与计算成本之间的权衡正成为时间序列预测中集成学习的一个极其相关的主题。为评估这一问题,我们在两个大型零售数据集(M5 和 VN1)上评估了十个基模型和八种集成配置,考虑在不同重新训练频率下进行的点预测和概率预测准确性。我们展示了集成在预测性能上始终具有一致的改善,尤其是在概率设置下。然而,这些收益伴随着巨大的计算成本,特别是对于较大、以准确性为导向的集成而言。我们发现,降低重新训练频率显著降低成本,尤其是在点预测方面,对准确性影响最小。此外,效率导向的集成提供了强大的平衡,实现了与准确性优化组合相比的竞争性准确性,同时成本大幅降低。最重要的是,只有两个或三个模型的小型集成往往就足以实现接近最优的结果。这些发现为部署可扩展且高效的预测系统提供了实用指南,支持可持续预测 AI 的更广泛目标。总体而言,本工作表明,小心设计的集成和重新训练策略选择可以产生准确、稳健且高效的预测,适用于实际应用场景。

关键词

引用

@article{arxiv.2506.04677,
  title  = {The cost of ensembling: is it always worth combining?},
  author = {Marco Zanotti},
  journal= {arXiv preprint arXiv:2506.04677},
  year   = {2025}
}