在类别不平衡学习中处理类间与类内不平衡
机器学习
2022-11-24 v2 人工智能
摘要
类别不平衡是机器学习实践中的一个常见问题。典型的不平衡学习(IL)方法通过直观的类别级重采样或重加权来平衡数据。然而,先前的研究表明,除了类别不平衡之外,诸如重叠、噪声和小析取项等内在数据难度因素也起着关键作用。为了处理这些问题,已经提出了许多解决方案(例如,噪声去除、边界采样、困难样本挖掘),但仍然局限于特定因素,无法推广到更广泛的场景,这引发了一个有趣的问题:如何以统一的方式处理类别无关的困难与类别不平衡?为了回答这个问题,我们同时考虑了类别不平衡及其正交面:类内不平衡,即简单样本和困难样本之间的不平衡分布。这种分布自然地反映了类别无关的内在数据困难的复杂影响,从而为在学习过程中识别和处理这些因素提供了一个新的统一视角。从这个视角出发,我们讨论了现有IL解决方案的优缺点,并进一步提出了新的平衡技术,以实现更鲁棒和高效的IL。最后,我们将所有解决方案整合到一个通用的集成IL框架中,即DuBE(双重平衡集成)。其特点是显式且高效的类间与类内平衡,以及通过标准化API易于扩展。大量实验验证了DuBE的有效性。代码、示例和文档可在https://github.com/AnonAuthorAI/duplebalance和https://duplebalance.readthedocs.io获取。
引用
@article{arxiv.2111.12791,
title = {Handling Inter-class and Intra-class Imbalance in Class-imbalanced Learning},
author = {Zhining Liu and Pengfei Wei and Zhepei Wei and Boyang Yu and Jing Jiang and Wei Cao and Jiang Bian and Yi Chang},
journal= {arXiv preprint arXiv:2111.12791},
year = {2022}
}
备注
15 pages, 4 tables, 12 figures