中文

卡方与泊松数据:即使在高计数区也存在偏差及其避免方法

天体物理学 2009-11-13 v1

摘要

我们证明了观测天文学家在拟合泊松分布数据时普遍采用的两种 chi^2 统计量近似,会导致模型参数估计产生内在偏差,即使在高计数区也是如此,除非在问题的参数化过程中十分谨慎。对于少数问题,先前的研究表明,当计数较高时,这些近似引入的分数偏差通常很小。然而,我们表明,对于一大类问题,除非数据区间数远小于 \sqrt{N_c}(其中 N_c 是数据集中的总计数),否则偏差仍可能相当于甚至超过统计误差。相反,我们发现当计数较高时,使用 Cash 的 C 统计量进行拟合可给出相对无偏的参数估计。考虑到它们在低计数区众所周知的缺陷,我们得出结论,不应常规性地使用这些近似的 chi^2 方法将任意参数化模型拟合到泊松分布数据,而不论每个区间的计数多少,而应采用 C 统计量。我们讨论了在真实数据建模中使用 C 统计量的几个实际方面。我们用两个具体问题说明了这种偏差:从光变曲线测量计数率,以及利用 Chandra X 射线天文台测量的 X 射线光谱获取热等离子体的温度。在 X 射线天文学的背景下,我们认为这种偏差可能导致卫星系统性的错误校准,以及星系团标度关系发生约 5-10% 的偏移。

关键词

引用

@article{arxiv.0811.2796,
  title  = {Chi-square and Poissonian Data: Biases Even in the High-Count Regime and How to Avoid them},
  author = {Philip J. Humphrey and Wenhao Liu and David A. Buote},
  journal= {arXiv preprint arXiv:0811.2796},
  year   = {2009}
}

备注

9 pages, 2 figures. Accepted for publication in the Astrophysical Journal