中文

基于 LSH 的高不平衡大数据集实例选择算法

机器学习 2022-10-11 v1 分布式、并行与集群计算 数据结构与算法

摘要

在真实场景中训练机器学习(ML)模型常需处理大数据集以及少数类(即感兴趣类别)样本不足的高类不平衡数据。使用经典 ML 模型的实际解决方案通过训练算法的并行/分布式实现、基于近似模型的方法或应用实例选择(IS)算法以消除冗余信息来应对大数据集问题。然而,大数据与高不平衡数据集的复合问题较少被研究。本文提出三种新的 IS 方法以处理大规模不平衡数据集。所提方法以局部敏感哈希(LSH)作为基础聚类技术,随后在 LSH 生成的簇(或桶)上应用三种不同的采样方法。算法在 Apache Spark 框架中开发,保证了可扩展性。在三个不同数据集上的实验表明,所提 IS 方法可将基础 ML 模型的几何均值性能提升 5% 至 19%。

关键词

引用

@article{arxiv.2210.04310,
  title  = {An Instance Selection Algorithm for Big Data in High imbalanced datasets based on LSH},
  author = {Germán E. Melo-Acosta and Freddy Duitama-Muñoz and Julián D. Arias-Londoño},
  journal= {arXiv preprint arXiv:2210.04310},
  year   = {2022}
}

备注

23 pages, 15 figures