中文

一种用于分类的无模型子数据选择方法

统计方法学 2024-05-01 v1 机器学习

摘要

子数据选择是研究如何从大数据中选取具有代表性的小样本的方法,其分析快速且统计高效。现有的子数据选择方法假设大数据可以用一个潜在模型合理建模,例如分类问题中的(多项)逻辑回归。当潜在建模假设正确时,这些方法效果极好,否则往往结果不佳。本文提出了一种用于分类问题的无模型子数据选择方法,所得子数据称为PED子数据。PED子数据使用决策树对数据进行划分,然后从每个划分分量中选取适当的样本。随机森林用于分析所选子数据。我们的方法适用于响应变量的一般类别数以及分类和连续预测变量。我们分析表明,PED子数据比均匀子数据具有更小的基尼系数。此外,通过大量模拟和真实数据集,我们证明PED子数据比其他竞争方法具有更高的分类准确率。

关键词

引用

@article{arxiv.2404.19127,
  title  = {A model-free subdata selection method for classification},
  author = {Rakhi Singh},
  journal= {arXiv preprint arXiv:2404.19127},
  year   = {2024}
}