中文

揭示多数据集在线回归的统计显著性

机器学习 2025-12-16 v1 人工智能

摘要

尽管已有大量研究关注在单一数据集上评估两种学习算法性能的技术,但在多种数据集上比较多个算法的统计检验这一关键挑战在大多数机器学习研究中仍被严重忽视。此外,在在线学习领域,确保统计显著性对于验证持续学习过程至关重要,特别是为了实现快速收敛并及时有效地管理概念漂移。需要稳健的统计方法来评估随时间演化数据的性能差异的显著性。本文考察了最先进的在线回归模型,并实证评估了若干合适的检验方法。为在多个数据集上比较多个在线回归模型,我们采用了 Friedman 检验及其对应的事后检验。为进行全面评估,同时使用真实和合成数据集,并结合 5 折交叉验证与种子平均,以确保在不同数据子集上的全面评估。我们的检验总体上确认了竞争性基线的性能与其单独报告的一致。然而,一些统计检验结果也表明,某些方面的最先进方法仍有改进空间。

关键词

引用

@article{arxiv.2512.12787,
  title  = {Unveiling Statistical Significance of Online Regression over Multiple Datasets},
  author = {Mohammad Abu-Shaira and Weishi Shi},
  journal= {arXiv preprint arXiv:2512.12787},
  year   = {2025}
}