超越合成增强:基于群体感知的阈值校准以实现不平衡学习中的稳健平衡准确率
机器学习
2025-09-04 v1 人工智能
摘要
类别不平衡是机器学习中的根本性挑战,传统方法往往会制造与之同样的问题。我们展示了群体感知阈值校准——即为不同人口统计群体设置不同的决策阈值——相对于合成数据生成方法提供了更好的鲁棒性。通过大量实验,我们表明,群组特定阈值比 SMOTE 和 CT-GAN 增强模型实现了 1.5-4% 的更高平衡准确率,同时提高了最差群体的平衡准确率。与针对所有群体应用单一阈值的方法不同,我们的群体感知方法优化了平衡准确率与最差群体平衡准确率之间的帕累托前沿,使能够对群体水平性能进行细粒度控制。关键地,我们发现将群体阈值应用于合成增强数据几乎没有额外的好处,表明这些方法在本质上是冗余的。我们的结果覆盖七种模型族,包括线性模型、基于树的模型、基于实例的模型和提升方法,确认群体感知阈值校准提供了一种更简单、更可解释且更有效的解决不平衡类别的方法。
引用
@article{arxiv.2509.02592,
title = {Beyond Synthetic Augmentation: Group-Aware Threshold Calibration for Robust Balanced Accuracy in Imbalanced Learning},
author = {Hunter Gittlin},
journal= {arXiv preprint arXiv:2509.02592},
year = {2025}
}
备注
Accepted to the AIDEM'25 conference at ECML; to be published in Springer (LNCS)