利用反事实方法进行数据增强以解决类不平衡问题
机器学习
2021-11-08 v1 人工智能
摘要
从类不平衡数据集学习对许多机器学习算法构成挑战。许多真实领域因其多数类天然拥有远多于少数类的实例而本质上是类不平衡的(例如真实银行交易远多于欺诈交易)。已有许多方法被提出以解决类不平衡问题,其中最流行的是过采样技术(如SMOTE)。这些方法在少数类中生成合成实例以平衡数据集,执行数据增强来提升预测机器学习(ML)模型的性能。本文提出一种新颖的数据增强方法(改编自可解释AI),在少数类中生成合成的反事实实例。与其他过采样技术不同,该方法自适应地组合数据集中已有实例,使用实际特征值而非在实例间插值。报告了使用四种不同分类器与25个数据集的若干实验,表明该反事实增强方法(CFA)能在少数类中生成有用的合成数据点。实验还显示CFA与许多其他过采样方法(多为SMOTE变体)具有竞争力。文中讨论了CFA性能的基础,以及其在未来测试中更可能表现更好或更差的条件。
引用
@article{arxiv.2111.03516,
title = {Solving the Class Imbalance Problem Using a Counterfactual Method for Data Augmentation},
author = {Mohammed Temraz and Mark T. Keane},
journal= {arXiv preprint arXiv:2111.03516},
year = {2021}
}
备注
47 pages, 4 figures