WEKA 中的随机森林分类器:针对不平衡数据的讨论与新进展
计算机视觉与模式识别
2019-01-07 v2
摘要
数据分析和机器学习已成为现代科学方法的组成部分,提供了基于观测预测进一步信息的自动化技术。这些分类与回归技术之一是随机森林方法。那些基于决策树的预测器以其良好的计算性能和可扩展性而著称。然而,在训练数据严重不平衡的情况下(如医学研究数据中常见的大对照组),必须改变训练算法或采样过程以提高对少数类的预测质量。本文提出了一种用于 WEKA 的平衡随机森林方法。此外,将 WEKA 中未修改的随机森林实现与新的平衡随机森林版本针对 R 中的参考实现进行了预测质量评估。研究了平衡数据集和不平衡医学研究数据上的两类问题。结果表明,与其他三种技术相比,所提方法在不平衡数据上表现出更优的预测质量。
引用
@article{arxiv.1812.08102,
title = {The Random Forest Classifier in WEKA: Discussion and New Developments for Imbalanced Data},
author = {Mario Amrehn and Firas Mualla and Elli Angelopoulou and Stefan Steidl and Andreas Maier},
journal= {arXiv preprint arXiv:1812.08102},
year = {2019}
}