中文

子群体相对于全群体的累积偏差

统计方法学 2021-10-18 v5 计算机与社会

摘要

评估子群体所受对待的公平性通常涉及为全群体中所有个体赋予数值“分数”,使相似个体获得相似分数;例如,通过倾向得分或适当协变量进行匹配是常见做法。给定此类分数后,具有相似分数的个体是否获得相似结果,可能独立于其在子群体中的成员身份。用于可视化不公平性的传统图形方法称为“可靠性图”或“校准图”,其将分数分箱为所有可能值的划分,并对每一箱同时绘制仅子群体内个体的平均结果以及所有个体的平均结果;比较子群体与全群体的图形可大致了解子群体平均值偏离全群体平均值的程度。遗憾的是,真实数据集仅含有限观测,限制了分箱可用分辨率,因此常规方法会因分箱而掩盖重要变异。幸而,本文提出的绘制子群体相对于全群体的累积偏差可规避有问题的粗分箱。累积图直接将子群体偏差编码为图形中割线的斜率。即便割线的恒定偏移无关紧要,斜率也易于察觉。累积方法避免了平滑掉子群体偏离全群体的分箱。此类累积聚合既提供了高分辨率图形方法,也提供了简单标量汇总统计量(类似于 Kuiper 以及 Kolmogorov 和 Smirnov 在比较概率分布的统计显著性检验中所用者)。

关键词

引用

@article{arxiv.2008.01779,
  title  = {Cumulative deviation of a subpopulation from the full population},
  author = {Mark Tygert},
  journal= {arXiv preprint arXiv:2008.01779},
  year   = {2021}
}

备注

70 pages, 51 figures, 2 tables; the new versions of the paper merge in most of arXiv:2006.02504