一种用于分类的无模型子数据选择方法
统计方法学
2024-05-01 v1 机器学习
摘要
子数据选择是研究如何从大数据中选取具有代表性的小样本的方法,其分析快速且统计高效。现有的子数据选择方法假设大数据可以用一个潜在模型合理建模,例如分类问题中的(多项)逻辑回归。当潜在建模假设正确时,这些方法效果极好,否则往往结果不佳。本文提出了一种用于分类问题的无模型子数据选择方法,所得子数据称为PED子数据。PED子数据使用决策树对数据进行划分,然后从每个划分分量中选取适当的样本。随机森林用于分析所选子数据。我们的方法适用于响应变量的一般类别数以及分类和连续预测变量。我们分析表明,PED子数据比均匀子数据具有更小的基尼系数。此外,通过大量模拟和真实数据集,我们证明PED子数据比其他竞争方法具有更高的分类准确率。
引用
@article{arxiv.2404.19127,
title = {A model-free subdata selection method for classification},
author = {Rakhi Singh},
journal= {arXiv preprint arXiv:2404.19127},
year = {2024}
}