中文

PLFit 估计量对幂律数据的一致性

统计理论 2020-02-18 v1 概率论 物理与社会 统计理论

摘要

我们证明了 Clauset 等人(2009)提出的 Power-Law Fit(PLFit)方法的一致性,该方法用于估计来自具有正则变化尾的分布函数的数据中的幂律指数。在复杂系统领域,PLFit 已成为估计幂律指数的首选方法。然而,其数学性质仍鲜为人知。PLFit 的困难在于它是一个最小距离估计量。它首先选择一个阈值,使大于该阈值的数据点与 Pareto 尾之间的 Kolmogorov-Smirnov 距离最小化,然后对此受限数据应用 Hill 估计量。由于所使用的顺序统计量个数是随机的,极值理论中幂律指数一致性的通用理论并不适用。我们的证明首先表明,即便所使用的顺序统计量个数是随机的,Hill 估计量对一般的中间序列仍是一致性的。此处,我们称一个序列为中间的,是指它趋于无穷,同时远小于样本量。第二步也是最为复杂的一步,是证明 PLFit 中的优化器以高概率为中间序列,除非分布在某值之上具有 Pareto 尾。对于后一特殊情况,我们给出了单独的证明。

关键词

引用

@article{arxiv.2002.06870,
  title  = {Consistency of the PLFit estimator for power-law data},
  author = {Ayan Bhattacharya and Bohan Chen and Remco van der Hofstad and Bert Zwart},
  journal= {arXiv preprint arXiv:2002.06870},
  year   = {2020}
}