面向医保欺诈的 ML 方法:关于类别不平衡解决方案、特征工程、自适应学习与业务影响的最新进展
机器学习
2025-02-25 v1 人工智能
摘要
医保欺诈构成了医疗系统面临的重大挑战,导致重大经济损失,并削弱了对合法受益者提供的护理质量。本研究探讨了使用机器学习 (ML) 来增强医保欺诈检测,解决关键挑战问题,如类别不平衡、高维数据和不断变化的欺诈模式。该研究使用由住院索赔、门诊索赔和受益者细节组成的数据集来训练和评估五个 ML 模型:随机森林、KNN、线性判别分析 (LDA)、决策树和 AdaBoost。数据预处理包括使用 SMOTE 方法进行抽样以解决类别不平衡问题、特征选择进行降维、以及对诊断和程序代码进行聚合。随机森林表现最佳,达到训练准确率为 99.2%、验证准确率为 98.8%,F1 分数为 98.4%。决策树也表现良好,验证准确率达到 96.3%。KNN 和 AdaBoost 表现中等,分别以 79.2% 和 81.1% 的验证准确率表现,而 LDA 在 63.3% 的验证准确率和仅 16.6% 的召回率方面表现不佳。结果表明,先进的抽样技术、特征工程和自适应学习在有效检测医保欺诈方面至关重要。本研究强调了机器学习在解决欺诈检测复杂性方面的潜力。未来工作应探索可解释人工智能和混合模型,以提高可解释性和性能,确保可扩展且可靠的欺诈检测系统,保护医疗资源和受益者。
引用
@article{arxiv.2502.15898,
title = {ML-Driven Approaches to Combat Medicare Fraud: Advances in Class Imbalance Solutions, Feature Engineering, Adaptive Learning, and Business Impact},
author = {Dorsa Farahmandazad and Kasra Danesh},
journal= {arXiv preprint arXiv:2502.15898},
year = {2025}
}