中文

自适应 MSD 划分:针对偏斜连续属性增强 C4.5 与随机森林

机器学习 2026-04-22 v1 人工智能

摘要

连续数值属性的离散化始终是决策树归纳过程中持续存在的计算瓶颈,尤其是在数据集维度增加时。基于近期提出的 MSD-Splitting 技术——该技术利用经验均值和标准差对连续数据进行分箱,从而大幅提升 C4.5 算法的效率与准确性——我们提出了自适应 MSD 划分(AMSD)。尽管标准的 MSD-Splitting 对于近似对称分布非常有效,但其对固定的一倍标准差截断点的严格遵循会导致在高度偏斜数据中产生灾难性的信息损失,而这在现实世界的生物医学与金融数据集中是常见的现象。AMSD 通过基于特征偏度动态调整标准差乘数来解决这一问题,在密集区域缩窄区间以保留判别分辨率。此外,我们将 AMSD 集成到集成方法中,特别提出了随机森林-AMSD(RF-AMSD)框架。在 Census Income、Heart Disease、Breast Cancer 和 Forest Covertype 数据集上的实验评估表明,AMSD 相比标准 MSD-Splitting 带来了 2-4% 的准确率提升,同时相比于 O(NlogN)O(N \log N) 的穷举搜索,维持了近乎一致的 O(N)O(N) 时间复杂度缩减。我们的随机森林扩展以标准计算成本的一小部分实现了 SOTA 准确率,证实了自适应统计分箱在大规模集成学习架构中的可行性。

关键词

引用

@article{arxiv.2604.19722,
  title  = {Adaptive MSD-Splitting: Enhancing C4.5 and Random Forests for Skewed Continuous Attributes},
  author = {Jake Lee},
  journal= {arXiv preprint arXiv:2604.19722},
  year   = {2026}
}