中文

通过最优路径森林处理不平衡数据集

机器学习 2022-02-21 v1

摘要

在过去十年中,基于机器学习的方法能够执行广泛的复杂任务,有时表现优于人类,且只需极少时间。这一进展部分归因于可用数据量的指数级增长,使得从中提取可信的真实世界信息成为可能。然而,此类数据通常是不平衡的,因为某些现象比其他现象更可能发生。这种行为对机器学习模型的性能产生显著影响,因为模型会对接收到的更频繁数据产生偏置。尽管存在大量机器学习方法,一种基于图的方法因在许多应用上的卓越表现而备受瞩目,即最优路径森林(OPF)。在本文中,我们提出三种基于 OPF 的策略来处理不平衡问题: O2\text{O}^2PF 和 OPF-US,分别是用于过采样和欠采样的新方法,以及结合两种方法的混合策略。本文还介绍了一组针对上述策略的变体。在公开和私有数据集上与多种最先进(state-of-the-art)技术比较的结果证实了所提方法的鲁棒性。

关键词

引用

@article{arxiv.2202.08934,
  title  = {Handling Imbalanced Datasets Through Optimum-Path Forest},
  author = {Leandro Aparecido Passos and Danilo S. Jodas and Luiz C. F. Ribeiro and Marco Akio and Andre Nunes de Souza and João Paulo Papa},
  journal= {arXiv preprint arXiv:2202.08934},
  year   = {2022}
}