RFOD:基于随机森林的表格数据异常检测方法
机器学习
2025-10-13 v1 数据库
摘要
表格数据异常检测对于保障高风险领域(如网络安全、金融欺诈检测和医疗保健)的数据完整性至关重要,因为异常情况可能导致严重的运营和经济影响。尽管数据挖掘和深度学习方法取得了进展,许多现有方法在处理混合类型表格数据时仍感困难,常依赖于会丢失重要语义信息的编码方案。此外,这些方法通常缺乏可解释性,对哪些具体数值导致异常几乎没有提供见解。为克服这些挑战,我们提出一种名为 RFOD 的新型基于随机森林的异常检测框架,专为表格数据设计。RFOD 不通过建模全局联合分布来实现,而是将异常检测重新表述为特征条件重构问题,为每个特征训练一个以其他特征为条件的专用随机森林。这种设计能够稳健地处理异构数据类型,同时保持分类特征的语义完整性。为进一步实现精确且可解释的检测,RFOD 结合了用于单元评分的调整Gower距离 (AGD),该方法适用于偏斜的数值数据并考虑分类置信度,同时采用不确定性加权平均 (UWA) 将单元评分聚合为稳健的行级异常评分。对15个真实数据集进行的广泛实验表明,RFOD 在检测准确性方面 consistently 优于最先进的基线方法,同时在混合类型表格数据方面表现出卓越的鲁棒性、可扩展性和可解释性。
引用
@article{arxiv.2510.08747,
title = {RFOD: Random Forest-based Outlier Detection for Tabular Data},
author = {Yihao Ang and Peicheng Yao and Yifan Bao and Yushuo Feng and Qiang Huang and Anthony K. H. Tung and Zhiyong Huang},
journal= {arXiv preprint arXiv:2510.08747},
year = {2025}
}
备注
13 pages, 13 figures, and 4 tables