中文

基于分箱收入数据的更好估计:插值累积分布函数与均值匹配

统计方法学 2017-10-18 v3

摘要

研究人员经常根据报告各分箱中收入数量的摘要来估计收入统计量,例如 010,000美元、0-10,000 美元、10,001-20,000 美元、...、$200,000 美元以上。一些分析师将收入分配给分箱中点,但这将收入视为离散的。其他分析师拟合连续参数分布,但该分布可能拟合不佳。我们通过插值累积分布函数(CDF)拟合非参数连续分布,完美再现了分箱计数。我们还展示了当收入均值已知时,如何约束中点和插值 CDF 以再现该均值。我们比较了这些方法在估计美国所有 3,221 个县的基尼系数时的准确性。拟合参数分布非常慢。拟合插值 CDF 要快得多,且精度略高。如果受约束以匹配已知均值,插值 CDF 和中点都能给出显著更好的估计。我们已在 R 的 binsmooth 包中实现了插值 CDF。我们已在 Stata 的 rpme 命令中实现了中点法。这两种实现均可受约束以匹配已知均值。

关键词

引用

@article{arxiv.1709.09705,
  title  = {Better estimates from binned income data: Interpolated CDFs and mean-matching},
  author = {Paul T. von Hippel and David J. Hunter and McKalie Drown},
  journal= {arXiv preprint arXiv:1709.09705},
  year   = {2017}
}

备注

20 pages (including Appendix), 3 tables, 2 figures (+2 in Appendix)