中文

Isolation Forest 归纳偏置的理论探究

机器学习 2026-01-28 v3 机器学习

摘要

Isolation Forest(iForest)作为一种广泛使用的无监督异常检测器,主要归功于其出色的运行效率和在大规模任务中的优异性能。尽管其应用广泛,但解释iForest成功之处的理论基础仍不清晰。本文聚焦于iForest的归纳偏置,这一理论阐明了iForest在何种情况下以及以何种程度上能够发挥作用。关键在于对iForest的生长过程进行建模,其中划分维度和划分值被随机选择。我们将iForest的生长过程建模为随机游走,借此通过转移概率推导出iForest的结果——即预期深度函数。案例研究揭示了关键归纳偏置:iForest对中心异常值的敏感性较低,而在参数适应性方面优于k近邻。我们的研究提供了对iForest有效性的理论理解,为进一步的理论探索奠定了基础。

关键词

引用

@article{arxiv.2505.12825,
  title  = {Theoretical Investigation on Inductive Bias of Isolation Forest},
  author = {Qin-Cheng Zheng and Shao-Qun Zhang and Shen-Huan Lyu and Yuan Jiang and Zhi-Hua Zhou},
  journal= {arXiv preprint arXiv:2505.12825},
  year   = {2026}
}