中文

回归任务中数据不平衡的模型无关缓解策略

机器学习 2025-06-03 v1

摘要

数据不平衡在回归任务中始终是一个普遍存在的挑战,它会在模型性能中引入偏差并削弱预测可靠性。这在旨在预测偏离大部分训练数据分布的罕见事件的应用中尤为不利。在本研究中,我们回顾了基于采样的方法和代价敏感学习的当前最新进展。此外,我们提出了缓解模型偏差的新方法。为了更好地评估数据的重要性,我们引入了密度-距离和密度-比率相关性函数,它们将数据的经验频率与特定领域的偏好有效结合,为最终用户提供了更好的可解释性。此外,我们提出了先进的缓解技术(cSMOGN 和 crbSMOGN),它们在现有采样方法的基础上进行了构建和改进。在全面的定量评估中,我们使用神经网络、XGBoost 树和随机森林模型,在 10 个合成数据集和 42 个真实世界数据集上对最先进的方法进行了基准测试。我们的分析表明,尽管大多数策略提高了罕见样本上的性能,但它们通常会降低频繁样本上的性能。我们证明,构建一个模型集成——其中一个使用不平衡缓解进行训练,另一个不使用——可以显著减少这些负面影响。关键发现强调了我们新颖的 crbSMOGN 采样技术与密度-比率相关性函数在神经网络上的卓越性能,优于现有最先进的方法。

关键词

引用

@article{arxiv.2506.01486,
  title  = {Model-agnostic Mitigation Strategies of Data Imbalance for Regression},
  author = {Jelke Wibbeke and Sebastian Rohjans and Andreas Rauh},
  journal= {arXiv preprint arXiv:2506.01486},
  year   = {2025}
}

备注

34 pages, 11 figures, to be submitted to Springer Nature Machine Learning