特征提取与类采样组合在医疗保险欺诈检测中的影响
机器学习
2022-06-29 v2
摘要
由于医疗保健至关重要,健康保险已成为减少医疗费用的重要方案。随之而来,由于保险的增加,医疗行业中的欺诈活动显著增加,欺诈已成为医疗费用上涨的重要因素,尽管其影响可通过欺诈检测技术加以缓解。为检测欺诈,使用了机器学习技术。美国联邦政府的医疗补助与医疗保险服务中心(CMS)发布的“Medicare Part D”保险理赔被用于本研究以开发欺诈检测系统。在类不平衡且高维的医疗保险数据集上采用机器学习算法是一项具有挑战性的任务。为应对此类挑战,本工作旨在执行特征提取后再进行数据采样,随后应用多种分类算法,以获得更好的性能。特征提取是一种降维方法,它将属性转换为实际属性的线性或非线性组合,生成更小且更多样化的属性集,从而减少维度。数据采样通常通过增加少数类的频率或减少多数类的频率以使两类出现次数大致相等,来应对类不平衡。所提方法通过标准性能指标进行评估。因此,为高效检测欺诈,本研究将自动编码器作为特征提取技术,将合成少数类过采样技术(SMOTE)作为数据采样技术,并将多种基于梯度提升决策树的分类器作为分类算法。实验结果表明,自动编码器后接SMOTE应用于LightGBM分类器的组合取得了最佳结果。
引用
@article{arxiv.2206.01413,
title = {Impact of the composition of feature extraction and class sampling in medicare fraud detection},
author = {Akrity Kumari and Narinder Singh Punn and Sanjay Kumar Sonbhadra and Sonali Agarwal},
journal= {arXiv preprint arXiv:2206.01413},
year = {2022}
}