中文

FOLD-SE 与 FOLD-R++ 在二分分类中的比较分析,以及 XGBoost 在多类别分类中的表现

机器学习 2025-09-24 v1

摘要

近期,寻求在准确性、效率和可解释性之间取得平衡的机器学习(ML)模型需求显著增长。传统上,准确性与可解释性之间存在权衡,神经网络等模型在复杂数据集上取得高准确率,但牺牲了内部透明度。因此,发展出新的基于规则的算法,如 FOLD-SE,提供以可解释规则集形式对预测进行明确解释的能力。本研究的主要目标是比较 FOLD-SE 与 FOLD-R++,这两种基于规则的分类器在二分分类中的表现,并评估 FOLD-SE 在应用于多类别分类时相对于 XGBoost 的性能。我们假设由于 FOLD-SE 能够以更易解释的方式生成压缩后的规则集,其在多类和二分分类中分别比 XGBoost 和 FOLD-R++ 损失最多 3 个百分点的准确率和 F1 分值。本研究使用数据集合进行分类,采用准确率、F1 分值和处理时间作为主要绩效指标。结果表明,FOLD-SE 在二分分类中优于 FOLD-R++,规则更少,但在处理时间和准确率方面损失较小;在涉及多类别分类的任务中,FOLD-SE 的准确性更高,效率更高,而且生成的规则集更具可理解性。结果表明,FOLD-SE 是二分任务和多类别分类的更佳选择。因此,这些结果表明,像 FOLD-SE 这样的基于规则的方法在可解释性和性能之间架起了桥梁,凸显其作为黑箱模型在多样分类任务中的可行替代方案的潜力。

关键词

引用

@article{arxiv.2509.18139,
  title  = {Comparative Analysis of FOLD-SE vs. FOLD-R++ in Binary Classification and XGBoost in Multi-Category Classification},
  author = {Akshay Murthy and Shawn Sebastian and Manil Shangle and Huaduo Wang and Sopam Dasgupta and Gopal Gupta},
  journal= {arXiv preprint arXiv:2509.18139},
  year   = {2025}
}

备注

7 pages