关于使用 M-分位数进行多元数据离群点检测
统计理论
2024-01-11 v2 最优化与控制
统计理论
摘要
半个多世纪以来,多元分位数的成功定义一直是一个悬而未决的问题,催生了大量可能的解决方案。其中,文献 [8] 和 [25] 提出的导致 M-分位数的方法因其结合了凸分析和概率论元素的数学优雅性而极具吸引力。其核心思想是描述一个凸函数(K-函数),其梯度(K-变换)在所有 R^d 与 R^d 中的单位球之间建立了一一对应关系。类似于 d=1 的情况下 K-变换是一个类似累积分布函数的对象(M-分布),其逆函数保证存在这一事实自然地为所有 d>=1 的分位数函数定义提供了基础。在过去的二十年中,由此产生的 M-分位数已在多个领域得到应用,主要用于在多维空间中检测离群点。在本文中,我们证明了对于奇数 d>=3,与密度函数(几乎处处)成正比的不是梯度,而是 K-函数的多次拉普拉斯算子。对于偶数 d,无法建立连接 K-函数与密度的微分方程。这些结果表明,在较高奇数维中使用 K-变换进行离群点检测原则上是有缺陷的,因为 K-变换并非源于真实 M-分布的反演。我们通过来自非标准非对称分布的例子在二维中展示了这些结论。我们的例子说明了 K-变换的一个特性,即定义域中密度较高的区域映射到上域中较大的体积,从而产生一种放大效应,使得内点比离群点更靠近上域的边界。这一特性显然会破坏任何依赖于逆 K-变换的离群点检测机制。
引用
@article{arxiv.2401.01628,
title = {On the use of the M-quantiles for outlier detection in multivariate data},
author = {Sajal Chakroborty and Ram Iyer and A. Alexandre Trindade},
journal= {arXiv preprint arXiv:2401.01628},
year = {2024}
}