中文

CLIMB:表格数据上的类别不平衡学习基准

机器学习 2025-10-21 v2 人工智能

摘要

表格数据上的类别不平衡学习(CIL)在许多现实应用中十分重要,因为少数类包含关键但罕见的结局。本文提出了 CLIMB,一个面向表格数据的类别不平衡学习综合基准。CLIMB 涵盖来自多个领域和不同程度不平衡的 73 个真实数据集,以及 29 个代表性 CIL 算法的统一实现。基于高质量开源 Python 包,采用统一 API 设计、详细文档和严格的代码质量控制,CLIMB 支持不同 CIL 算法的便捷实现与比较。通过大量实验,本文提供了关于方法准确性和效率的实用见解,揭示了朴素再平衡的局限性、集成方法的有效性以及数据质量的重要性。代码、文档和示例可在 https://github.com/ZhiningLiu1998/imbalanced-ensemble 获取。

关键词

引用

@article{arxiv.2505.17451,
  title  = {CLIMB: Class-imbalanced Learning Benchmark on Tabular Data},
  author = {Zhining Liu and Zihao Li and Ze Yang and Tianxin Wei and Jian Kang and Yada Zhu and Hendrik Hamann and Jingrui He and Hanghang Tong},
  journal= {arXiv preprint arXiv:2505.17451},
  year   = {2025}
}

备注

NeurIPS 2025, Dataset and Benchmark Track. 18 pages, 7 figures, 8 tables