类别不平衡约束下少数类财务困境预测的机器学习方法比较评估
机器学习
2026-05-15 v1
摘要
由于现实世界财务数据集具有高度不平衡的特性,破产或困境企业通常仅占观测样本的极少数,财务困境预测仍是企业风险分析中的一项重大挑战。本文对经典统计方法、集成学习方法和探索性神经模型在类别不平衡约束下的少数类财务困境预测进行了比较评估。该研究包含结构化预处理、使用合成少数类过采样技术(SMOTE)进行不平衡缓解、跨集成学习架构(包括 XGBoost、CatBoost、LightGBM、Random Forest)的比较评估,以及使用基于 SHAP 的特征归因方法进行的可解释性分析。实验评估表明,在严重不平衡条件下,梯度提升方法相较于基线统计分类器获得了更高的少数类敏感性。该工作流程还强调了企业财务风险环境中机器学习评估的可复现性、可解释性、可审计性与面向治理的评估。本工作定位为一项应用工程评估,旨在支持在严重类别不平衡约束下用于财务困境预测的可复现且可解释的机器学习工作流程。
引用
@article{arxiv.2605.14067,
title = {Comparative Evaluation of Machine Learning Approaches for Minority-Class Financial Distress Prediction Under Class Imbalance Constraints},
author = {Karan Sehgal and Khawar Naveed Bhatti},
journal= {arXiv preprint arXiv:2605.14067},
year = {2026}
}
备注
16 pages, 4 figures, preprint under review. Applied machine learning evaluation involving imbalance-aware financial distress prediction, ensemble learning, SMOTE, and SHAP explainability analysis