中文

SR4-Fit:一种可解释且信息丰富的分类算法及其在美国众议院选举预测中的应用

机器学习 2026-02-09 v1 人工智能

摘要

机器学习的发展要求关键应用具有可解释的模型,然而大多数高性能模型是掩盖输入-输出关系的“黑箱”系统,而像RuleFit这样的传统基于规则的算法尽管简单,却缺乏预测能力和稳定性。这促使我们开发了稀疏松弛正则化回归规则拟合(SR4-Fit),这是一种新颖的可解释分类算法,它在保持优越分类性能的同时解决了这些局限性。利用美国人口普查局美国社区调查中美国国会选区的人口统计特征,我们证明了SR4-Fit能够以前所未有的准确性和可解释性预测众议院选举的政党结果。我们的结果表明,虽然多数党仍然是最强的预测因子,但SR4-Fit揭示了影响预测结果的人口统计因素的内在组合,而这些组合在随机森林等黑箱算法中是无法解释的。SR4-Fit算法在准确性、简洁性和鲁棒性方面均超越了黑箱模型和现有的可解释基于规则的算法(如RuleFit),生成了稳定且可解释的规则集,同时保持了优越的预测性能,从而解决了选举预测中模型可解释性与预测能力之间的传统权衡。为进一步验证SR4-Fit的性能,我们还将其应用于另外六个公开可用的分类数据集,如乳腺癌、Ecoli、页面块、皮马印第安人、车辆和酵母数据集,并发现了类似的结果。

关键词

引用

@article{arxiv.2602.06229,
  title  = {SR4-Fit: An Interpretable and Informative Classification Algorithm Applied to Prediction of U.S. House of Representatives Elections},
  author = {Shyam Sundar Murali Krishnan and Dean Frederick Hougen},
  journal= {arXiv preprint arXiv:2602.06229},
  year   = {2026}
}

备注

8 pages, 2 figures, 7 tables, to appear in the 24th IEEE AMLA International Conference on Machine Learning and Applications (ICMLA'25)