增强扩展隔离森林的可解释性与泛化能力
机器学习
2024-10-10 v3 机器学习
应用统计
摘要
异常检测(AD)致力于在复杂数据集中识别异常行为。机器学习(ML)算法与决策支持系统(DSS)为异常检测提供了有效解决方案,但仅检测异常可能并不足够,尤其在工程领域,诊断与维护至关重要。用户需要清晰的说明以支持根因分析并建立对模型的信任。然而,异常检测的无监督特性使得可解释性成为一项挑战。本文提出扩展隔离森林特征重要性(ExIFFI)方法,用于解释由扩展隔离森林(EIF)模型做出的预测,该模型利用超平面分割数据。ExIFFI通过利用特征重要性在全局与局部两个层面提供解释。我们还提出改进版本——增强型扩展隔离森林(EIF+),旨在通过修正的分割策略提升模型检测未见异常的能力。我们使用五个合成数据集与十一个真实数据集开展对比分析,以平均精度(Average Precision)指标评估无监督异常检测方法。EIF+在所有数据集上(训练时不包含异常)均持续优于EIF,展现出更好的泛化能力。为评估ExIFFI的可解释性,我们提出特征选择曲线下面积(AUC_FS)这一新颖指标,以特征选择作为代理任务。在11个真实数据集中的8个上,ExIFFI优于其他无监督可解释性方法,并成功识别合成数据集中的异常特征。当仅以正常样本训练时,ExIFFI在真实数据上也优于对比模型,并准确检测合成数据集中的异常特征。我们提供开源代码以促进进一步研究与可复现性。
引用
@article{arxiv.2310.05468,
title = {Enhancing Interpretability and Generalizability in Extended Isolation Forests},
author = {Alessio Arcudi and Davide Frizzo and Chiara Masiero and Gian Antonio Susto},
journal= {arXiv preprint arXiv:2310.05468},
year = {2024}
}