面向不平衡数据集的自适应聚类基于合成少数类过采样技术用于交通方式选择预测
机器学习
2025-04-15 v1
摘要
城市数据集(如市民交通方式)常包含不成比例分布的类别,为数据驱动模型对少数类的分类带来显著挑战。文献中已发展出各种抽样方法,用于为少数类创建合成数据(过采样)或从多数类中移除样本(欠采样),以缓解类别不平衡问题。然而,过采样方法倾向于对高度聚类的少数类进行过度泛化,忽视可能包含关键信息的稀疏区域。相反,欠采样方法可能移除某些子群的有用信息。因此,需要一种考虑数据内在分布的抽样方法,以确保合适的合成数据创建。本文提出一种自适应聚类基于合成少数类过采样技术。对少数类的输入特征应用基于密度的空间聚类,以识别基于其输入特征的子群。然后根据这些子群中类的比例对其进行过采样,该比例为其本地聚类中数据点数目与最大多数类的比值。当与机器学习模型(如随机森林和极端梯度提升)联合使用时,此过采样方法在少数类上实现了显著提升的F1分数。这些改进模型提供了准确的交通方式分类。
引用
@article{arxiv.2504.09486,
title = {Adaptive Cluster-Based Synthetic Minority Oversampling Technique for Traffic Mode Choice Prediction with Imbalanced Dataset},
author = {Guang An Ooi and Shehab Ahmed},
journal= {arXiv preprint arXiv:2504.09486},
year = {2025}
}
备注
6 pages, 3 figures, 6 tables, IEEE conference format